做過超短線策略研究的人都知道,最累的並不只是「計算」。
看到訊號 A 時怎麼辦?B 同時出現呢?高波動時保留,低波動時過濾?這個時段順勢,那個時段乾脆不進場?
如果每種情況都自己試,普通的晚上很快就變成私人研究室。每天花幾個小時,連續好幾年,最後只留下少數能看的策略,完全不奇怪。
然後,探索型 AI 出現了。
在一種研究流程裡,AI 可以在數小時尺度內測試數千種變化,繼續分析「為什麼收益不穩」,再把失敗原因拿去決定下一輪要試什麼。
人的直覺反應很簡單:
「這要是叫人一個個做,到底要做幾天?」
但如果結論變成「AI 能測 4,000 個,所以無敵」,金融研究反而更危險。因為試得越多,就越容易找到只是偶然貼合歷史資料的漂亮答案。[1][2]
更強的組合是:
人的假設 × AI 探索 × AI 反證 × 大規模搜尋的統計修正。
不只要有找贏家的 AI,也要有專門把贏家打爛的 AI。
1. 為什麼幾年的人工研究會突然被壓縮
手工作策略研究,本質上是很多小步驟的循環:
- 提出假設。
- 實作條件。
- 回測。
- 看結果。
- 問「為什麼不穩」。
- 拆分條件。
- 再測一次。
每一步都不一定特別困難,真正沉重的是重複幾百次、幾千次。
人還會付出切換成本:昨天測到哪裡?這個過濾器是不是測過?這個結果是在改交易成本之前還是之後?
探索 AI 的價值就在於能讓循環不中斷。
它不需要停在「有賺」,還能繼續問:是不是只靠幾天?加入成本會不會消失?是不是只在某個時段有效?少一個部件會不會崩?
這不只是更快的回測。
而是研究迭代本身更快。
2. Astra 的強項更像「能在未知環境裡走」,不是「先知道答案」
ARC-AGI-3 很適合看這種能力。
它是一個互動式基準:AI 面對全新的二維網格環境,沒有自然語言說明,也沒有直接公布目標。AI 必須自己探索、推斷規則、建立環境模型、找到目標、規劃並在失敗後調整。[3][4]
2026 年 7 月,GPT-5.6 Sol 在 ARC Prize 的半私有集合上得到 7.78%。OpenAI 也在公開集合的另一種執行方式中示範,保留推理狀態並使用脈絡壓縮,可讓 Sol 從 13.3% 提升到 38.3%。[5]
9 月,Astra 在 ARC Prize 的標準執行方式下,於同一半私有集合得到 62.7%;使用可在動作之間保留更多推理狀態的 Provider Adapter 時達到 99.9%。因為執行架構對分數影響很大,不能把 99.9 對 7.78 當成完全同條件的倍數比較。真正重要的是探索、狀態建模與長程適應能力出現了明顯跳升。[6][3]
ARC Prize 還報告,在 Astra 完成的關卡中,有 96% 使用的動作數少於完成人類的中位數。[3]
這跟「一次解出一道超難數學題」不是完全同一種強。
它比較像:
「碰一下這個會怎樣?那再試那個。喔,原來規則是這樣。」
表面看起來像小學生也願意玩的二維遊戲,長期以來卻可以難住前沿 AI,正好讓互動探索能力的變化變得很明顯。
ARC Prize 也明確說,ARC-AGI-3 被做滿不代表已證明 AGI;封閉、確定的遊戲環境和真實世界仍然不同。[3]
3. 為什麼二維遊戲的探索流程會讓人想到超短線研究
市場不是確定性遊戲。價格由參與者、資訊、制度、成交限制與不斷改變的市場狀態共同形成。
但研究流程卻可以很像。
假設加入委託簿失衡條件後,回測變好。
接下來必須繼續問:
- 真的是委託簿失衡本身有預測力嗎?
- 只在高波動時有效嗎?
- 只是因為那段時間買賣價差較低嗎?
- 成交差一個最小跳動單位就消失嗎?
- 只存在某個交易時段嗎?
觀察,改條件,看回饋,更新假設。
這與 ARC-AGI-3 的「感知 → 行動 → 回饋 → 更新模型 → 下一步行動」在研究結構上相近。[3][4]
所以比「找出最賺錢的參數」更好的指令是:
「拆解這個利潤為什麼存在,找出哪些條件能把它殺死,再把死亡原因變成下一輪實驗。」
4. 人的經驗不會消失——「這一帶聞起來有東西」就是搜尋地圖
可以讓 AI 從零開始搜,但搜尋空間越大,人的長期經驗越像一張「先從哪裡挖」的地圖。
讀過大量資料、親手測過很多訊號的人,通常會形成這種壓縮知識:
- 單獨很弱,但當過濾器可能有用;
- 只在趨勢市場有意義;
- 回測很漂亮,但交易成本一加就碎;
- 比起預測方向,更適合阻止差的進場;
- 看起來很強,但可能只集中在某段歷史。
這些不是答案。
而是搜尋空間的先驗提示。
科學領域也有相似設計。2026 年的 Co-Scientist 從研究者設定的目標與既有證據出發,反覆生成、批評、排序與演化假設,並隨測試時計算量增加持續探索。[7]
金融研究也可以這樣做。
人先說「這裡值得先挖」。
AI 把附近數千條分支挖一遍。
如果結果推翻人的直覺,就讓證據贏。
經驗最好拿來分配搜尋預算,而不是當不可質疑的答案。
5. 為什麼多條件組合用人力會變成地獄
假設有 20 個元件。
每個元件只有「用」或「不用」兩種選擇,就已經有:
2^20 = 1,048,576 種組合。
如果變成「不用、正常用、反向用」三種選擇,就是:
3^20 = 3,486,784,401 種組合。
實務上當然不會全部暴力枚舉,領域知識會先砍掉很多無意義組合。
但真正的策略研究還會疊加門檻、時段、波動狀態、價差、持倉時間、新聞排除、多空不對稱、成交假設等。
所以過去那種
「再加這個看看?這裡排除?只在這種市場狀態用?」
本質上就是人類在手動走一棵巨大的條件搜尋樹。
花幾年很正常。
試算表沒有錯。宇宙太大了。
6. 真正該交給 AI 的不是無腦窮舉,而是選擇下一個實驗
好的探索系統會根據剛得到的結果改變下一步。
如果策略是 A+B+C+D,就一個個拿掉元件。
- 拿掉 D 幾乎不變 → D 可能只是裝飾。
- B 單獨很弱,但 A+B 明顯降低回撤 → B 可能是過濾器,不是預測訊號。
- C 全期間普通,但高波動時很強 → C 可能依賴市場狀態。
這種拿掉部件來理解貢獻的檢查,通常稱為消融測試。
名字不重要,目的才重要:
把複雜策略拆開,只留下真正有功能的部件。
探索 → 失敗 → 分類失敗原因 → 選下一個實驗。
這條循環自動化後,AI 才開始從參數最佳化工具變成研究助手。
7. 最大風險還是過度擬合——測 4,000 個,總會出現一個「運氣天才」
這一步在金融最關鍵。
如果測 4,000 個策略,只展示最漂亮的一個,那個贏家可能只是最幸運地貼合歷史資料。
White 對資料窺探的經典討論指出:同一份資料反覆用於推論與模型選擇時,滿意的結果可能只是偶然,而不是方法真的更好。[1]
多訊號組合會更糟。
Novy-Marx 說明,多訊號策略容易產生嚴重過度擬合偏誤;即使是沒有真實預測力的隨機訊號,也可能透過挑選與組合製造出看起來高度顯著的回測。[2]
所以探索能力是雙刃劍。
AI 可以比人快很多倍地犯錯。
然後再從錯誤裡選出最漂亮的那個頒獎。
搜尋越大,防過度擬合就越必須成為搜尋機制的一部分,而不是最後才做的儀式。
8. 防過度擬合從「記錄所有嘗試,並封存最後資料」開始
如果研究了數千個候選,失敗候選也是證據。
至少可以把以下流程工程化:
- 記錄全部試驗。 改了什麼、試了多少、為什麼淘汰。
- 探索資料與最終驗證資料分離。 選模型時不要一直偷看最後集合。
- 依時間向前驗證。 在較早資料建立,往較晚資料檢查,也就是 walk-forward 類型的前推驗證。
- 故意讓成交條件變差。 提高價差、手續費、滑價、延遲,採更悲觀成交假設。
- 擾動參數。 只有一個神奇門檻能活的策略要警戒。
- 拆市場狀態。 看收益是否只集中在某一年、時段、波動狀態、方向或極少數交易。
- 修正大量嘗試造成的選擇偏誤。
DSR 用來修正多重測試的選擇偏誤,以及非正態收益對 Sharpe 比率解讀的影響。[8]
PBO 是為投資回測提出的過度擬合機率框架,用組合對稱交叉驗證估計模型選擇把歷史擬合過頭的可能性。[9]
White 的 Reality Check 處理多候選下的資料窺探;Hansen 的 SPA 檢定則減少很差或無關候選對檢驗能力的干擾。[1][10]
不用背全部縮寫。
記住一句:
「4,000 次裡選出的第一名,就按 4,000 人參賽的第一名來審。」
而且一旦看過封存資料並據此改策略,這份資料就不再封存。
9. 最強配置可能是兩個 AI:一個找贏家,一個殺贏家
可以直接分工。
探索 AI
- 生成新條件;
- 重組人的假設;
- 找不同市場狀態下的效果;
- 把失敗原因變成新實驗。
反證 AI
- 惡化成本;
- 延遲成交;
- 移除部分日期;
- 擾動門檻;
- 換期間、換市場;
- 做 DSR、PBO、Reality Check、SPA 類修正;
- 檢查收益是否只來自少數交易。
探索端說:「找到了。」
反證端說:「真的嗎?」
活下來,再打一輪。
金融研究裡,這種不好相處的個性就是品質控制。
目標也應該從「歷史最高獲利」改成:
「假設、參數、成本和樣本被合理破壞後,仍可解釋、仍能存活的結構。」
10. 新模型推出時,不要只看總分;要找上一代突然跨不過、這一代突然跨過的能力
這不只適用超短線交易。
新 AI 發布時,如果只看綜合基準多幾個百分點,很可能錯過真正的商業機會。
更重要的問題是:
「上一代做起來不划算的工作,這一代是不是突然可行了?」
Astra 在 ARC-AGI-3 顯示出的能力,包括探索陌生環境、建立壓縮世界模型、保持狀態與高效率行動。[3]
接著把這種能力對回現實瓶頸:
- 哪些工作最耗時間的是決定下一步試什麼?
- 哪些地方有成千上萬個可驗證假設?
- 成敗能否客觀量化?
- 重複次數越多,人力成本差距是否越大?
- 更好的探索是否會轉成獲利、降低成本或加快研發?
重疊越多,機會越值得看。
科學界的 Co-Scientist 已在用「生成 → 批評 → 比較 → 演化」的循環擴大假設探索。[7]
所以新模型發布可以不只是看規格,而是一場尋寶:
「以前最折磨人的哪段研究循環,突然可以用機器規模執行?」
最後一句:
人先畫第一張地圖。AI 挖到地圖外。統計學負責問:發亮的到底是不是金礦。
AI 越強,越需要有人保持懷疑。
這個懷疑者,也可以是另一個 AI。
資料來源
- Halbert White — A Reality Check for Data Snooping, Econometrica 68(5), 2000 onlinelibrary.wiley.com
- Robert Novy-Marx — Backtesting Strategies Based on Multiple Signals, NBER Working Paper 21329, 2015 nber.org
- ARC Prize — OpenAI's GPT-6 Astra on ARC-AGI-3 (2026-09-03) arcprize.org
- ARC Prize — Announcing ARC-AGI-3 / ARC-AGI-3 documentation https://docs.arcprize.org/ arcprize.org
- OpenAI — How two settings tripled our ARC-AGI-3 scores (GPT-5.6 Sol) openai.com
- OpenAI — GPT-6 Astra: A new generation of intelligence openai.com
- Juraj Gottweis et al. — Accelerating scientific discovery with Co-Scientist, Nature, 2026 nature.com
- David H. Bailey & Marcos López de Prado — The Deflated Sharpe Ratio: Correcting for Selection Bias, Backtest Overfitting, and Non-Normality, 2014 doi.org
- David H. Bailey, Jonathan Borwein, Marcos López de Prado & Qiji Jim Zhu — The Probability of Backtest Overfitting, 2015 papers.ssrn.com
- Peter Reinhard Hansen — A Test for Superior Predictive Ability, Journal of Business & Economic Statistics 23(4), 2005 tandfonline.com
