做过超短线策略研究的人都知道,最累的并不只是“算”。
看到信号 A 时怎么办?B 同时出现呢?高波动时保留,低波动时过滤?这个时段顺势,那个时段直接不进?
如果每一种情况都自己试,普通的晚上很快就会变成私人研究所。每天花几小时,连续几年,最后只留下一个能看的策略,并不奇怪。
然后,探索型 AI 出现了。
在一种探索流程里,AI 可以在数小时尺度内测试数千个变体,继续分析“为什么收益不稳定”,再把失败原因变成下一轮实验。
人的第一反应很自然:
“这要是让人一个个做,得做多少天?”
但如果结论变成“AI 能测 4,000 个,所以无敌”,金融研究反而更危险。因为试得越多,越容易找到偶然贴合历史数据的漂亮结果。[1][2]
更合理的组合是:
人的假设 × AI 探索 × AI 反证 × 对大规模搜索做统计修正。
不仅要有寻找赢家的 AI,还要有专门负责把赢家打碎的 AI。
1. 为什么几年的人工作业会突然被压缩
人工策略研究通常是很多小步骤的循环:
- 提出假设。
- 写出条件。
- 回测。
- 看结果。
- 问“为什么不稳定”。
- 拆条件。
- 再试一次。
每一步都未必特别难,真正沉重的是重复几百次、几千次。
人还会付出上下文切换成本:昨天试到哪里了?这个过滤器是不是已经测过?这个结果是在修改交易成本前还是后?
探索 AI 的价值,就是可以让这个循环不断往前走。
它不必停在“有利润”,还可以继续问:是不是只靠几天?加入成本会不会消失?是不是只在一个时段有效?拿掉一个部件会不会崩?
这不仅是更快的回测。
而是研究迭代本身更快。
2. Astra 的强项更像“能在未知环境里走”,而不是“提前知道答案”
ARC-AGI-3 很适合说明这种能力。
它是一个交互式基准:AI 面对全新的二维网格环境,没有自然语言说明,也没有直接告诉目标。它必须自己探索、推断规则、建立环境模型、找出目标、规划并在失败后调整。[3][4]
2026 年 7 月,GPT-5.6 Sol 在 ARC Prize 的半私有集合上得到 7.78%。OpenAI 还在公开集合上展示过:如果保留推理状态并使用上下文压缩,Sol 在另一种运行方式下可从 13.3% 提升到 38.3%。[5]
9 月,Astra 在 ARC Prize 的标准运行方式下,于同一半私有集合得到 62.7%;使用能在动作之间保留更多推理状态的 Provider Adapter 时达到 99.9%。由于运行方式对分数影响很大,不能把 99.9 和 7.78 粗暴地当成同条件倍率比较。真正值得关注的是探索、状态建模和长程适应出现了明显跃升。[6][3]
ARC Prize 还报告,在 Astra 完成的关卡中,有 96% 使用的动作数少于完成人类的中位数。[3]
这和“一次解出一道超难数学题”不是完全同一种强。
它更像:
“碰一下这个会怎样?那再试那个。哦,原来规则是这样。”
表面看起来像小学生也愿意玩的二维小游戏,长期以来却能难住前沿 AI,这正好让交互式探索能力的变化变得很明显。
ARC Prize 也明确表示,ARC-AGI-3 被做满并不等于证明已经实现 AGI;封闭、确定的游戏环境与真实世界仍然不同。[3]
3. 为什么二维游戏的探索过程会让人想到超短线研究
市场不是确定性游戏。价格由大量参与者、制度、信息、执行条件和不断变化的市场状态共同形成。
但研究流程却可能很像。
假设加入盘口失衡条件后,回测变好了。
接下来必须继续问:
- 真的是盘口失衡本身有预测力吗?
- 只在高波动时有效吗?
- 只是因为那段时间点差低吗?
- 成交价格差一个最小价位就会消失吗?
- 只存在于某个交易时段吗?
观察,改变条件,看反馈,修改假设。
这与 ARC-AGI-3 的“感知 → 行动 → 反馈 → 更新模型 → 下一步行动”在研究结构上相似。[3][4]
所以比“找最赚钱参数”更好的指令是:
“拆解利润为什么存在,找出什么条件会把它杀死,再把死亡原因变成下一轮实验。”
4. 人的经验不会消失——“这一带有味道”本身就是地图
当然可以让 AI 从零开始搜。
但搜索空间越大,人的长期经验越像一个“先从哪里挖”的地图。
读过大量资料、亲手试过很多信号的人,往往会形成这种压缩判断:
- 单独很弱,但可能适合当过滤器;
- 只在趋势状态下有意义;
- 回测很好看,但交易成本一上来就碎;
- 与其预测方向,不如用来阻止错误入场;
- 看起来很强,但可能只集中在某一段历史。
这些不是答案。
而是搜索空间的先验提示。
科学领域也在采用类似结构。2026 年的 Co-Scientist 从研究者设定的问题和既有证据出发,反复生成、批评、排序和演化假设,并通过增加测试时计算量继续探索。[7]
金融研究也可以这样:
人先说“这里比较值得挖”。
AI 把附近数千条分支挖一遍。
如果结果否定人的经验,就让证据赢。
经验最适合当搜索预算分配器,而不是不可挑战的结论。
5. 为什么多个条件组合用人力会变成地狱
假设有 20 个组件。
每个组件只有“用”或“不用”两个选择,也已经有:
2^20 = 1,048,576 种组合。
如果变成“不用、正常使用、反向使用”三种选择,则是:
3^20 = 3,486,784,401 种组合。
现实中当然不会全量暴力枚举,领域知识会先砍掉很多没有意义的组合。
但真实的策略研究还会叠加阈值、时段、波动状态、点差、持仓时间、新闻过滤、做多做空差异、成交假设等。
所以过去那种
“再看一个条件呢?这里排除呢?只在这个市场状态用呢?”
本质上就是人类在手动走一棵巨大的条件搜索树。
花几年并不奇怪。
表格软件没犯错。宇宙太大了。
6. 真正应该交给 AI 的不是无脑穷举,而是选择“下一个最有信息量的实验”
好的探索系统会根据刚得到的结果改变下一步。
如果策略是 A+B+C+D,就把组件一个个拆掉。
- 去掉 D 几乎没变化 → D 可能只是装饰。
- B 单独没效果,但 A+B 明显降低回撤 → B 可能是过滤器,不是预测源。
- C 全局一般,但高波动时很强 → C 可能依赖市场状态。
这种通过移除部件来理解贡献的检查,常被称为消融测试。
名称不重要,目的才重要:
把复杂策略拆开,只留下真正承担功能的部件。
探索 → 失败 → 分类失败原因 → 选择下一轮探索。
自动化这条循环后,AI 才从参数优化器变成研究助手。
7. 最大风险仍然是过拟合——测 4,000 个,总会冒出一个“运气天才”
这一步在金融里最重要。
如果测试 4,000 个策略,只展示最漂亮的一个,那么这个赢家可能只是最幸运地贴合了历史数据。
White 对数据窥探问题的经典讨论指出:当同一份数据被反复用于推断和模型选择时,满意结果可能只是偶然,而不是方法本身真正更好。[1]
多信号组合会把问题继续放大。
Novy-Marx 说明,多信号策略容易产生严重过拟合偏差;即使随机生成、没有真实预测能力的信号,也能通过选择和组合制造出看起来高度显著的回测。[2]
因此,探索能力是一把双刃剑。
AI 可以比人快很多倍地犯错。
然后还能从错误里选出最漂亮的那个颁奖。
搜索越大,防过拟合就越不能放在最后走流程,而必须写进搜索机制本身。
8. 防过拟合从“记录所有试验,并把最后数据封起来”开始
如果研究了数千个候选,失败的候选也是证据的一部分。
至少应该把这些步骤工程化:
- 记录全部试验。 试了多少、改了什么、为什么丢弃。
- 探索数据和最终验证数据分离。 模型选择过程中不要反复偷看最终集合。
- 按时间向前验证。 用更早的数据开发,再在更晚的数据上验证,也就是滚动式前推检验。
- 故意把执行条件变差。 提高点差、手续费、滑点、延迟,并采用更悲观的成交假设。
- 扰动参数。 只有一个神奇阈值能活的策略需要警惕。
- 拆市场状态。 看利润是否只集中在一年、一个时段、一种波动状态、一个方向或极少数交易。
- 修正大量尝试带来的选择偏差。
DSR 用于修正多重测试导致的选择偏差,以及非正态收益对 Sharpe 比率解释的影响。[8]
PBO 是为投资回测提出的过拟合概率框架,通过组合对称交叉验证估计选择过程把历史拟合过头的可能性。[9]
White 的 Reality Check 处理多个候选下的数据窥探;Hansen 的 SPA 检验则在此基础上减少很差或无关候选对检验能力的干扰。[1][10]
不必背完缩写。
只记住一句:
“4,000 次里选出来的第一名,就按 4,000 人参加的比赛第一名来审。”
而且一旦看过所谓封存的最终数据并据此修改策略,这份数据就不再封存。
9. 最强配置可能是两个 AI:一个找赢家,一个杀赢家
可以直接分工。
探索 AI
- 生成新条件;
- 重组人的假设;
- 寻找不同市场状态下的作用;
- 把失败原因变成新实验。
反证 AI
- 恶化成本;
- 延迟成交;
- 删除部分日期;
- 扰动阈值;
- 换时期、换市场;
- 做 DSR、PBO、Reality Check、SPA 一类修正;
- 检查收益是否只来自少数交易。
探索端说:“找到了。”
反证端说:“真的吗?”
活下来,再打一次。
金融研究里,这种不好相处的性格就是质量控制。
目标也应该从“历史最大利润”改成:
“假设、参数、成本和样本被合理破坏后,仍能解释、仍能存活的结构。”
10. 新模型发布时,不要只看总分;要找“上一代突然跨不过去、这一代突然跨过去”的能力
这不只是超短线交易的经验。
新 AI 发布时,如果只看综合基准多了几个百分点,很容易错过真正的商业机会。
更重要的问题是:
“上一代做起来不划算的工作,这一代是不是突然能做了?”
Astra 在 ARC-AGI-3 上突出显示的能力包括探索陌生环境、建立紧凑的世界模型、保持状态并高效行动。[3]
然后把这种能力映射回现实:
- 哪些工作里,人最耗时间的是决定下一步试什么?
- 哪些地方有成千上万可验证的假设?
- 成败能不能客观计量?
- 重复次数越多,人力成本差是否越大?
- 更好的探索是否会直接转化为利润、成本下降或研发速度?
重叠越多,机会越值得看。
科学界的 Co-Scientist 已经在用“生成假设 → 批评 → 比较 → 演化”的循环扩大研究探索。[7]
所以新模型发布可以不只是看参数表,而是当成一次寻宝:
“过去最折磨人的哪一段研究循环,突然可以机器规模执行了?”
最后一句:
人先画第一张地图。AI 挖到地图之外。统计学负责问:闪光的到底是不是金矿。
AI 越强,越需要有人保持怀疑。
这个怀疑者,也可以是另一个 AI。
资料来源
- Halbert White — A Reality Check for Data Snooping, Econometrica 68(5), 2000 onlinelibrary.wiley.com
- Robert Novy-Marx — Backtesting Strategies Based on Multiple Signals, NBER Working Paper 21329, 2015 nber.org
- ARC Prize — OpenAI's GPT-6 Astra on ARC-AGI-3 (2026-09-03) arcprize.org
- ARC Prize — Announcing ARC-AGI-3 / ARC-AGI-3 documentation https://docs.arcprize.org/ arcprize.org
- OpenAI — How two settings tripled our ARC-AGI-3 scores (GPT-5.6 Sol) openai.com
- OpenAI — GPT-6 Astra: A new generation of intelligence openai.com
- Juraj Gottweis et al. — Accelerating scientific discovery with Co-Scientist, Nature, 2026 nature.com
- David H. Bailey & Marcos López de Prado — The Deflated Sharpe Ratio: Correcting for Selection Bias, Backtest Overfitting, and Non-Normality, 2014 doi.org
- David H. Bailey, Jonathan Borwein, Marcos López de Prado & Qiji Jim Zhu — The Probability of Backtest Overfitting, 2015 papers.ssrn.com
- Peter Reinhard Hansen — A Test for Superior Predictive Ability, Journal of Business & Economic Statistics 23(4), 2005 tandfonline.com
