短期取引の戦略を手作業で研究したことがある人なら、いちばん重いのは「計算」だけではないと分かる。
この指標を見たときはどうする。別の指標が同時に出たらどうする。高ボラなら残すか。低ボラなら捨てるか。ここでは逆張り、ここでは見送り――。
一つずつ確かめていると、平日の夜がそのまま研究所になる。毎日数時間を年単位で積み上げて、ようやく一本の戦略が残ることすらある。
そこへ、探索型AIが来る。
ある探索では数千パターンを数時間単位で回し、利益が安定しない理由まで分解して、次の候補へ進める。人間側の第一声はだいたい同じになる。
「それ、人間にやらせたら何日かかるんだよ。」
ただし、ここで「AIなら4000本試せる。最強!」で終わると危ない。金融では、たくさん試せること自体が過学習の増幅器にもなるからだ。
この記事の結論はシンプルである。
強い組み合わせは、人間の仮説 × AIの探索力 × AI自身による反証 × 統計的な過学習補正。
勝ち戦略を探すAIだけでは足りない。見つけた勝ち戦略を全力で壊しにいくAIまでセットで必要になる。
1. なぜ「数年の手作業」がAIでは急に圧縮されるのか
人間の戦略研究は、実は小さな作業の連鎖でできている。
- 仮説を思いつく。
- 条件を実装する。
- バックテストする。
- 結果を見る。
- 「なぜ安定しない?」を考える。
- 条件を分ける。
- もう一度試す。
一個一個は難しくなくても、これを何百回、何千回と続けるのが重い。
しかも途中で「昨日どこまで試した?」「この条件、前にもやった?」が入る。人間の脳には研究ログ管理機能が標準搭載されていない。いや、搭載されている人もいるのかもしれないが、少なくともアップデート通知は来ない。
探索AIの価値は、この反復を止めずに回せることにある。
「利益が出た」で終わらず、「特定の日だけでは?」「コストを入れると?」「別の時間帯では?」「この条件を外したら?」と枝を増やし、死んだ理由を次の仮説へ戻す。
これは単なる高速バックテストではない。
研究ループそのものの高速化である。
2. Astraの強さは「正解を知っている」より「未知環境を歩ける」に近い
GPT-6 Astraの特徴を理解するのに分かりやすいのがARC-AGI-3である。
ARC-AGI-3は、説明書も明示的なゴールもない2Dグリッド型の環境をAIが操作し、何が起きるかを観察しながらルールを推定する対話型ベンチマークだ。必要なのは、探索、環境モデルの構築、ゴール推定、計画と修正である。
2026年7月のGPT-5.6 Solは、ARC Prizeの半非公開セットで7.78%を記録した。OpenAIは別の公開セット検証で、推論状態の保持と文脈圧縮を使うと13.3%から38.3%まで伸びることも示している。
9月のAstraは、ARC Prizeの標準ハーネスで同じ半非公開セット62.7%、推論状態をより長く保持できるProvider Adapterで99.9%を記録した。評価条件で数字は大きく変わるので単純な倍率比較はできないが、探索・モデル化・長期状態保持の能力が大きく伸びたことは読み取れる。
さらにARC Prizeは、Astraが完走したレベルの96%で、人間の完走者中央値より少ない操作数を使ったと報告している。
ここが面白い。
難しい数学問題を一発で解く強さとは少し違う。
「これ押したら何が起きる? じゃあ次はこっち。あ、ルール分かった。」
という探索の強さである。
小学生でも遊べそうな2Dゲームが、AIには長く難しかった。だからこそ、そこでの急伸は「未知の環境を触りながら理解する能力」の変化を見やすい。
なおARC Prize自身も、ARC-AGI-3の飽和をAGI達成の証明とはしていない。閉じた決定論的な環境と、現実世界の複雑さは別物である。
3. 2Dゲームの探索が、なぜスキャルピング研究と似て見えるのか
相場はゲームではない。価格形成は閉じた決定論的ルールでもない。
それでも「研究の手順」だけを見ると、かなり似た形になる。
たとえば、板の偏りを条件に追加したら成績が改善したとする。
そこで終わらない。
- 板の偏り自体が効いているのか。
- 高ボラのときだけ効くのか。
- 低スプレッドだから見えているだけか。
- 約定を1ティック悪化させると消えるのか。
- 特定時間帯だけなのか。
観測する。条件を変える。結果を見る。仮説を書き換える。
構造としては、ARC-AGI-3の「観測 → 操作 → 反応 → 世界モデル更新 → 次の操作」と近い。
だから探索型AIに向いている指示は、「一番儲かるパラメータを探せ」より、
「この利益がなぜ出ているのかを分解し、壊れる条件を探し、死んだ理由から次の候補を作れ」
の方になる。
勝ち筋を当てるクイズではない。
未知の地形を歩かせる研究ゲームとして渡すのである。
4. 人間の価値は消えない――むしろ「この辺が臭い」が高価になる
AIに全部ゼロから探させればいい、と考えたくなる。
でも、探索空間が大きいほど、人間の経験は「どこから掘るか」を決める地図になる。
長年、本を読み、指標や価格構造を一つずつ試した人は、頭の中にこんな分類を持っている。
- 単体では弱いが、除外条件として効きそう。
- トレンド時だけ使えそう。
- バックテストではきれいだが、コストで消えやすい。
- 方向予測よりエントリーを止める用途の方が強い。
- 一見強いが、特定期間だけに集中しやすい。
これは「正解一覧」ではない。
探索の事前分布である。
科学分野でも、2026年のCo-Scientistは、研究者が与えた目標や既知の証拠を出発点に、仮説を生成し、批判し、順位付けし、改良する反復構造を採っている。計算時間を増やしながら仮説空間を掘る設計だ。
金融でも発想は同じでよい。
人間が「ここは強そう」と種を置く。
AIはその周囲を何千方向も掘る。
そして人間の仮説に反する結果が出たら、遠慮なく捨てる。
経験は答えではなく、探索予算をどこへ配るかのヒントとして使う。
これなら「経験者の思い込み」と「AIの総当たり」の弱点を、お互いに少しずつ打ち消せる。
5. 複数条件の組み合わせが人力だと地獄になる理由
材料が20個あるとする。
各材料を「使う・使わない」の2択にするだけで、組み合わせは
2^20 = 1,048,576通り。
さらに「使わない・順方向に使う・逆方向に使う」の3択なら、
3^20 = 3,486,784,401通り。
もちろん現実には全部を総当たりしない。意味のない組み合わせを人間の知識で切る。
それでも実戦の研究では、ここへ閾値、時間帯、ボラティリティ、スプレッド、保有時間、ニュース除外、買いと売りの非対称、約定条件などが乗る。
つまり昔の研究者がやっていた、
「これを見たときはどう? じゃあこっちも見たら? この局面では除外?」
は、実質的に巨大な条件付き探索木を人力で歩いていたことになる。
そりゃ数年かかる。
Excelが悪いわけではない。宇宙が広すぎる。
6. AIにやらせたいのは総当たりではなく「次に何を試すべきか」の選択
探索能力が高いAIの使い道は、全パラメータを無差別に舐めることではない。
良い探索は、結果から次の実験を変える。
たとえば戦略がA+B+C+Dで構成されているなら、部品を一つずつ外して成績変化を見る。
- Dを外しても変わらない → Dは飾りかもしれない。
- B単体では弱いが、A+Bでドローダウンだけ減る → Bは予測器ではなくフィルターかもしれない。
- Cは全期間で弱いが、高ボラだけ強い → Cは相場状態に依存する部品かもしれない。
こうした「部品を外して役割を見る検査」は、一般にアブレーションと呼ばれる。
重要なのは名前ではなく、複雑な戦略を分解して、本当に効いている部品だけ残すことだ。
探索 → 失敗 → 原因分類 → 次の探索。
この循環を自動化すると、AIは単なるパラメータ検索器から、研究助手に近づく。
7. ただし最大の敵は過学習――4000回試せば「偶然の天才」も出てくる
金融で一番怖いのはここである。
4000個の戦略を試して一番きれいなものだけ選べば、その勝者は実力ではなく偶然で勝った可能性がある。
Whiteは、同じデータを推論やモデル選択に繰り返し使う「データスヌーピング」では、良い結果が手法の本当の能力ではなく偶然から出る可能性があると整理した。
複数シグナルはさらに危ない。
Novy-Marxは、複数のシグナルを選択・結合すると過学習バイアスが強くなり、真の予測力を持たないランダムなシグナルからでも、見栄えのよいバックテストを作れてしまうことを示している。
つまり探索AIの強さは両刃の剣だ。
人間より4000倍たくさん間違えられる。
そして、その中から一番美しい間違いだけを表彰することもできてしまう。
探索量が増えるほど、過学習対策は「最後の確認」ではなく「探索器の設計そのもの」にしなければならない。
8. 過学習対策は「全試行を記録し、最後のテストをAIにも見せない」から始める
大量探索をするなら、失敗した3999本も研究履歴である。
最低限、次を工程化したい。
- 全trialを記録する。 何個試して、どの条件を変え、なぜ捨てたかを残す。
- 探索用データと最終確認用データを分ける。 最終確認用は、モデル選択中に見ない。
- 時系列で前へ進む検証をする。 過去で作って未来側で確かめるウォークフォワードを使う。
- コストを悪化させる。 スプレッド、手数料、スリッページ、遅延、約定条件を厳しくする。
- 近いパラメータでも生きるかを見る。 一点だけ尖る戦略を警戒する。
- 相場状態を分ける。 高ボラ、低ボラ、時間帯、年、方向などで利益集中を確認する。
- 大量試行の補正を入れる。
大量に候補を試したせいでシャープレシオが盛られる分を補正する方法が、Deflated Sharpe Ratio、略してDSRである。選択バイアスと収益分布の非正規性を考慮する。
投資バックテスト向けに「最適化しすぎた確率」を推定する枠組みがProbability of Backtest Overfitting、PBOで、組合せ対称交差検証という方法を使う。
WhiteのReality Checkは大量候補からのデータスヌーピングを検定する方法で、HansenのSuperior Predictive Ability検定、SPAは、弱い・無関係な候補の影響を受けにくくする方向で改良された。
名前を全部覚える必要はない。
考え方は一つである。
「4000本試したあとに一番強かった」なら、4000本試した事実ごと評価しろ。
そして最終の未使用データを見たあとで戦略を直したら、そのデータはもう未使用ではない。修正版には新しい封印データが必要になる。
9. 最強構成は「勝ち戦略を探すAI」と「勝ち戦略を殺すAI」の二人体制
探索AIを一人だけ置くと、どうしても「良いものを探す」方向へ寄りやすい。
そこで役割を分ける。
探索側
- 新しい条件を作る。
- 人間の仮説を組み替える。
- 相場状態ごとの効き方を掘る。
- 失敗理由から次の候補を作る。
反証側
- コストを悪化させる。
- 約定を遅らせる。
- 日を抜く。
- パラメータをずらす。
- 別期間、別市場へ持っていく。
- DSR、PBO、Reality Check、SPAなどで大量探索を補正する。
- 利益が一部の日や一部の取引だけに集中していないか調べる。
探索側が「見つけた!」と持ってきたら、反証側が「本当に?」と殴る。
生き残ったら、もう一回殴る。
金融研究では、この性格の悪さが品質である。
目標は「最高利益」ではなく、
「条件を少し壊しても、別の期間でも、コストを悪化させても、理由を説明できる形で残るもの」
に変えた方がいい。
10. 新モデルが出るたびに見るべきは「総合点」より「前世代で急に壁を越えた能力」
この話はスキャルピングだけではない。
新しいAIモデルが出たとき、総合ベンチマークが5%上がったかを見るだけでは、稼ぎどころを見逃す。
見るべきは、
「前のモデルでは採算が合わなかった仕事が、今回は急に成立した場所はどこか」
である。
Astraなら、ARC-AGI-3で目立ったのは、未知環境を探索し、圧縮した世界モデルを作り、少ない操作で進む能力だった。
そこから逆算する。
- 大量の仮説を試す仕事はないか。
- 人間が「次に何を試すか」で時間を失う業務はないか。
- 成否を数字で検証できるか。
- 100回、1000回と反復したとき人件費差が大きいか。
- その能力差が利益、コスト、開発速度に直結するか。
この5つが重なるところは面白い。
科学でも、Co-Scientistのように「仮説生成 → 批判 → 比較 → 改良」を計算量で回す方向が実際に進んでいる。
だから新モデル発表は、スペック表を見るイベントではなく、
「人間が昔死ぬほど面倒だった工程の、どれが突然機械化できた?」を探す宝探し
として見るとよい。
短期取引研究では、答えが見え始めている。
人間が何年もかけて得た「この辺が強そう」という勘は、捨てるものではない。
それをAIに渡して、何千本も掘らせる。
ただし、同じAIに自分の成果を壊させ、統計ゲートを通し、最後の未使用データまで残す。
最短のまとめはこれである。
人間は探索の地図を描く。AIは地図の外まで掘る。統計は「それ、本当に金脈?」と最後に止める。
AIが強くなるほど、最後の一人だけは冷静でなければならない。
その一人もAIにやらせればいいのだが。
