GPT-6 Astra 的探索能力如何用在超短線研究?——過去靠人幾年才篩完的組合,現在 AI 能成千上萬地挖;真正可怕的是過度擬合

做過超短線策略研究的人都知道,最累的並不只是「計算」。

廣告
廣告

做過超短線策略研究的人都知道,最累的並不只是「計算」。

看到訊號 A 時怎麼辦?B 同時出現呢?高波動時保留,低波動時過濾?這個時段順勢,那個時段乾脆不進場?

如果每種情況都自己試,普通的晚上很快就變成私人研究室。每天花幾個小時,連續好幾年,最後只留下少數能看的策略,完全不奇怪。

然後,探索型 AI 出現了。

在一種研究流程裡,AI 可以在數小時尺度內測試數千種變化,繼續分析「為什麼收益不穩」,再把失敗原因拿去決定下一輪要試什麼。

人的直覺反應很簡單:

「這要是叫人一個個做,到底要做幾天?」

但如果結論變成「AI 能測 4,000 個,所以無敵」,金融研究反而更危險。因為試得越多,就越容易找到只是偶然貼合歷史資料的漂亮答案。[1][2]

更強的組合是:

人的假設 × AI 探索 × AI 反證 × 大規模搜尋的統計修正。

不只要有找贏家的 AI,也要有專門把贏家打爛的 AI。

1. 為什麼幾年的人工研究會突然被壓縮

手工作策略研究,本質上是很多小步驟的循環:

  1. 提出假設。
  2. 實作條件。
  3. 回測。
  4. 看結果。
  5. 問「為什麼不穩」。
  6. 拆分條件。
  7. 再測一次。

每一步都不一定特別困難,真正沉重的是重複幾百次、幾千次。

人還會付出切換成本:昨天測到哪裡?這個過濾器是不是測過?這個結果是在改交易成本之前還是之後?

探索 AI 的價值就在於能讓循環不中斷。

它不需要停在「有賺」,還能繼續問:是不是只靠幾天?加入成本會不會消失?是不是只在某個時段有效?少一個部件會不會崩?

這不只是更快的回測。

而是研究迭代本身更快。

2. Astra 的強項更像「能在未知環境裡走」,不是「先知道答案」

ARC-AGI-3 很適合看這種能力。

它是一個互動式基準:AI 面對全新的二維網格環境,沒有自然語言說明,也沒有直接公布目標。AI 必須自己探索、推斷規則、建立環境模型、找到目標、規劃並在失敗後調整。[3][4]

2026 年 7 月,GPT-5.6 Sol 在 ARC Prize 的半私有集合上得到 7.78%。OpenAI 也在公開集合的另一種執行方式中示範,保留推理狀態並使用脈絡壓縮,可讓 Sol 從 13.3% 提升到 38.3%。[5]

9 月,Astra 在 ARC Prize 的標準執行方式下,於同一半私有集合得到 62.7%;使用可在動作之間保留更多推理狀態的 Provider Adapter 時達到 99.9%。因為執行架構對分數影響很大,不能把 99.9 對 7.78 當成完全同條件的倍數比較。真正重要的是探索、狀態建模與長程適應能力出現了明顯跳升。[6][3]

ARC Prize 還報告,在 Astra 完成的關卡中,有 96% 使用的動作數少於完成人類的中位數。[3]

這跟「一次解出一道超難數學題」不是完全同一種強。

它比較像:

「碰一下這個會怎樣?那再試那個。喔,原來規則是這樣。」

表面看起來像小學生也願意玩的二維遊戲,長期以來卻可以難住前沿 AI,正好讓互動探索能力的變化變得很明顯。

ARC Prize 也明確說,ARC-AGI-3 被做滿不代表已證明 AGI;封閉、確定的遊戲環境和真實世界仍然不同。[3]

3. 為什麼二維遊戲的探索流程會讓人想到超短線研究

市場不是確定性遊戲。價格由參與者、資訊、制度、成交限制與不斷改變的市場狀態共同形成。

但研究流程卻可以很像。

假設加入委託簿失衡條件後,回測變好。

接下來必須繼續問:

  • 真的是委託簿失衡本身有預測力嗎?
  • 只在高波動時有效嗎?
  • 只是因為那段時間買賣價差較低嗎?
  • 成交差一個最小跳動單位就消失嗎?
  • 只存在某個交易時段嗎?

觀察,改條件,看回饋,更新假設。

這與 ARC-AGI-3 的「感知 → 行動 → 回饋 → 更新模型 → 下一步行動」在研究結構上相近。[3][4]

所以比「找出最賺錢的參數」更好的指令是:

「拆解這個利潤為什麼存在,找出哪些條件能把它殺死,再把死亡原因變成下一輪實驗。」

4. 人的經驗不會消失——「這一帶聞起來有東西」就是搜尋地圖

可以讓 AI 從零開始搜,但搜尋空間越大,人的長期經驗越像一張「先從哪裡挖」的地圖。

讀過大量資料、親手測過很多訊號的人,通常會形成這種壓縮知識:

  • 單獨很弱,但當過濾器可能有用;
  • 只在趨勢市場有意義;
  • 回測很漂亮,但交易成本一加就碎;
  • 比起預測方向,更適合阻止差的進場;
  • 看起來很強,但可能只集中在某段歷史。

這些不是答案。

而是搜尋空間的先驗提示。

科學領域也有相似設計。2026 年的 Co-Scientist 從研究者設定的目標與既有證據出發,反覆生成、批評、排序與演化假設,並隨測試時計算量增加持續探索。[7]

金融研究也可以這樣做。

人先說「這裡值得先挖」。

AI 把附近數千條分支挖一遍。

如果結果推翻人的直覺,就讓證據贏。

經驗最好拿來分配搜尋預算,而不是當不可質疑的答案。

5. 為什麼多條件組合用人力會變成地獄

假設有 20 個元件。

每個元件只有「用」或「不用」兩種選擇,就已經有:

2^20 = 1,048,576 種組合。

如果變成「不用、正常用、反向用」三種選擇,就是:

3^20 = 3,486,784,401 種組合。

實務上當然不會全部暴力枚舉,領域知識會先砍掉很多無意義組合。

但真正的策略研究還會疊加門檻、時段、波動狀態、價差、持倉時間、新聞排除、多空不對稱、成交假設等。

所以過去那種

「再加這個看看?這裡排除?只在這種市場狀態用?」

本質上就是人類在手動走一棵巨大的條件搜尋樹。

花幾年很正常。

試算表沒有錯。宇宙太大了。

6. 真正該交給 AI 的不是無腦窮舉,而是選擇下一個實驗

好的探索系統會根據剛得到的結果改變下一步。

如果策略是 A+B+C+D,就一個個拿掉元件。

  • 拿掉 D 幾乎不變 → D 可能只是裝飾。
  • B 單獨很弱,但 A+B 明顯降低回撤 → B 可能是過濾器,不是預測訊號。
  • C 全期間普通,但高波動時很強 → C 可能依賴市場狀態。

這種拿掉部件來理解貢獻的檢查,通常稱為消融測試。

名字不重要,目的才重要:

把複雜策略拆開,只留下真正有功能的部件。

探索 → 失敗 → 分類失敗原因 → 選下一個實驗。

這條循環自動化後,AI 才開始從參數最佳化工具變成研究助手。

7. 最大風險還是過度擬合——測 4,000 個,總會出現一個「運氣天才」

這一步在金融最關鍵。

如果測 4,000 個策略,只展示最漂亮的一個,那個贏家可能只是最幸運地貼合歷史資料。

White 對資料窺探的經典討論指出:同一份資料反覆用於推論與模型選擇時,滿意的結果可能只是偶然,而不是方法真的更好。[1]

多訊號組合會更糟。

Novy-Marx 說明,多訊號策略容易產生嚴重過度擬合偏誤;即使是沒有真實預測力的隨機訊號,也可能透過挑選與組合製造出看起來高度顯著的回測。[2]

所以探索能力是雙刃劍。

AI 可以比人快很多倍地犯錯。

然後再從錯誤裡選出最漂亮的那個頒獎。

搜尋越大,防過度擬合就越必須成為搜尋機制的一部分,而不是最後才做的儀式。

8. 防過度擬合從「記錄所有嘗試,並封存最後資料」開始

如果研究了數千個候選,失敗候選也是證據。

至少可以把以下流程工程化:

  1. 記錄全部試驗。 改了什麼、試了多少、為什麼淘汰。
  2. 探索資料與最終驗證資料分離。 選模型時不要一直偷看最後集合。
  3. 依時間向前驗證。 在較早資料建立,往較晚資料檢查,也就是 walk-forward 類型的前推驗證。
  4. 故意讓成交條件變差。 提高價差、手續費、滑價、延遲,採更悲觀成交假設。
  5. 擾動參數。 只有一個神奇門檻能活的策略要警戒。
  6. 拆市場狀態。 看收益是否只集中在某一年、時段、波動狀態、方向或極少數交易。
  7. 修正大量嘗試造成的選擇偏誤。

DSR 用來修正多重測試的選擇偏誤,以及非正態收益對 Sharpe 比率解讀的影響。[8]

PBO 是為投資回測提出的過度擬合機率框架,用組合對稱交叉驗證估計模型選擇把歷史擬合過頭的可能性。[9]

White 的 Reality Check 處理多候選下的資料窺探;Hansen 的 SPA 檢定則減少很差或無關候選對檢驗能力的干擾。[1][10]

不用背全部縮寫。

記住一句:

「4,000 次裡選出的第一名,就按 4,000 人參賽的第一名來審。」

而且一旦看過封存資料並據此改策略,這份資料就不再封存。

9. 最強配置可能是兩個 AI:一個找贏家,一個殺贏家

可以直接分工。

探索 AI

  • 生成新條件;
  • 重組人的假設;
  • 找不同市場狀態下的效果;
  • 把失敗原因變成新實驗。

反證 AI

  • 惡化成本;
  • 延遲成交;
  • 移除部分日期;
  • 擾動門檻;
  • 換期間、換市場;
  • 做 DSR、PBO、Reality Check、SPA 類修正;
  • 檢查收益是否只來自少數交易。

探索端說:「找到了。」

反證端說:「真的嗎?」

活下來,再打一輪。

金融研究裡,這種不好相處的個性就是品質控制。

目標也應該從「歷史最高獲利」改成:

「假設、參數、成本和樣本被合理破壞後,仍可解釋、仍能存活的結構。」

10. 新模型推出時,不要只看總分;要找上一代突然跨不過、這一代突然跨過的能力

這不只適用超短線交易。

新 AI 發布時,如果只看綜合基準多幾個百分點,很可能錯過真正的商業機會。

更重要的問題是:

「上一代做起來不划算的工作,這一代是不是突然可行了?」

Astra 在 ARC-AGI-3 顯示出的能力,包括探索陌生環境、建立壓縮世界模型、保持狀態與高效率行動。[3]

接著把這種能力對回現實瓶頸:

  • 哪些工作最耗時間的是決定下一步試什麼?
  • 哪些地方有成千上萬個可驗證假設?
  • 成敗能否客觀量化?
  • 重複次數越多,人力成本差距是否越大?
  • 更好的探索是否會轉成獲利、降低成本或加快研發?

重疊越多,機會越值得看。

科學界的 Co-Scientist 已在用「生成 → 批評 → 比較 → 演化」的循環擴大假設探索。[7]

所以新模型發布可以不只是看規格,而是一場尋寶:

「以前最折磨人的哪段研究循環,突然可以用機器規模執行?」

最後一句:

人先畫第一張地圖。AI 挖到地圖外。統計學負責問:發亮的到底是不是金礦。

AI 越強,越需要有人保持懷疑。

這個懷疑者,也可以是另一個 AI。


資料來源

  1. Halbert White — A Reality Check for Data Snooping, Econometrica 68(5), 2000 onlinelibrary.wiley.com
  2. Robert Novy-Marx — Backtesting Strategies Based on Multiple Signals, NBER Working Paper 21329, 2015 nber.org
  3. ARC Prize — OpenAI's GPT-6 Astra on ARC-AGI-3 (2026-09-03) arcprize.org
  4. ARC Prize — Announcing ARC-AGI-3 / ARC-AGI-3 documentation https://docs.arcprize.org/ arcprize.org
  5. OpenAI — How two settings tripled our ARC-AGI-3 scores (GPT-5.6 Sol) openai.com
  6. OpenAI — GPT-6 Astra: A new generation of intelligence openai.com
  7. Juraj Gottweis et al. — Accelerating scientific discovery with Co-Scientist, Nature, 2026 nature.com
  8. David H. Bailey & Marcos López de Prado — The Deflated Sharpe Ratio: Correcting for Selection Bias, Backtest Overfitting, and Non-Normality, 2014 doi.org
  9. David H. Bailey, Jonathan Borwein, Marcos López de Prado & Qiji Jim Zhu — The Probability of Backtest Overfitting, 2015 papers.ssrn.com
  10. Peter Reinhard Hansen — A Test for Superior Predictive Ability, Journal of Business & Economic Statistics 23(4), 2005 tandfonline.com
廣告
Mendoi-chan

作者

Mendoi-chan

把工作與日常生活中的麻煩整理成清楚的結構與下一步行動。

關於本站
廣告

最新文章

  1. 1AI代理會讓人類變得不再必要嗎?用環境設計與趨勢感知打造「老闆被工廠趕出去」的自治媒體
  2. 2長時間運行的 AI Agent 要不要記錄進度?用 Heartbeat 避免「是不是停了?」
  3. 3用一支手機把「資深工程師級」開發交給AI,結果搬家先結束了——AI代理時代,不會親自寫程式到底有多大問題?
  4. 4AI文章自動化危險嗎?把即時反應、可靠證據、持續改進與自有網站連成「活的媒體系統」
  5. 5工廠比1,500篇文章先蓋起來了:探索、結構化、改善與自動化如何被AI複利式放大

推薦閱讀

廣告