1. 本来只想疾走打脸,结果长出了一座研究所
最初的问题很简单:现在什么卡组最强?收集公开卡组,固定规则,让CPU互殴几万场,最后看排名就好。
现实很快给了一拳:能正确执行规则的AI,不等于会打牌的AI。 Set 8固定了826张卡、engine commit、environment hash、合法卡组和seed。历史baseline 12,480场已经做到rule coverage 100%、unsupported 0、rule gap 0,但原始AI仍给出皇家约79.8%、精灵63.7%、龙60.9%、巫师25.6%的异世界成绩。
把错误重复一万次不会变成真理,只会制造一台非常稳定地犯错的机器。
2. 加入人类经验后,AI变弱了
human-prior-v1加入了保留关键资源、尊重setup、保存进化资源等常见经验。exact A/B包含2,016 paired units与4,032 engine games。baseline为50.99%,human-prior-v1为49.36%,下降-1.64pt。
AI听了人类建议,成绩反而更差。
原因在于人类建议有上下文。“留牌”在这回合不用就会死时当然不成立;“抢场”也不意味着摧毁唯一的combo路线。固定权重保留了句子,却杀死了条件。
3. Adaptive v2提高平均值,却把巫师打坏了
Adaptive v2在LETHAL、SURVIVE、STABILIZE、SETUP、RESOURCE、PRESSURE等目标间切换,并加入浅层搜索、隐藏手牌近似与future value。整体比v1高+0.74pt,但Runecraft下降-6.25pt,突破预注册leader floor -5pt,因此REJECT。
后续T11对v1为+0.30pt,但对reference-v5为-2.38pt,Abyss更是-16.67pt,再次REJECT。
平均分看着及格,打开答卷发现一门课在燃烧。
4. 做根因分析时,研究人员先被抓了
发现过一个真实实现缺陷:配置了max_nodes=160却没有真正接到planner,9,067个decision超过名义上限。但接好后广泛胜率仍未改善。
更大的事故是actor attribution。一项被标成“loss→win”的干预其实按fixed player视角统计;从真正改变行动的actor视角看,结果是win→loss。研究员把受害者当成犯人抓了。
actor、direction与invariant修复后,分析平台更可靠了,但AI性能真凶仍然在逃。
5. 31,406场后,“还不知道”成为正式结论
Set 8策略研究最终包含20项实验、31,406场确认的actual engine games。439个discordant units中,完整因果解释性能原因的为0,部分解释11,未解决428。
研究以PAUSED_COMPLETE_NO_PROMOTION结束,active仍为human-prior-v1,原定8,064场final unseen holdout完全没有使用。
成果不是“超级AI”,而是不会因为某张漂亮图表就错误晋升AI的研究装置。
6. 接着让52套市场卡组打了46,900场
市场corpus包含52 decks、25 archetypes、7 leaders。quick、broad、1~3张局部优化、unseen-seed排名与guide trace合计形成46,900场actual engine games。
最后7套推荐卡组再进行直接round robin:21 unordered pairs、1,512 games,每个非对角cell 72场,reference-v5与human-prior-v1各756场,先后手各756场。coverage 100%,unsupported、rule gap、hidden-info violation全部为0。
7. “无脑互殴排名”诞生
| 排名 | 推荐卡组 | 直接7×7平均 | 最差对局 |
|---|---|---|---|
| 1 | Buff Forest | 71.99% | Abyss 59.72% |
| 2 | Rally Sword | 65.97% | Forest 31.94% |
| 3 | Midrange Abyss | 54.17% | 40.3% |
| 4 | Artifact Portal | 54.17% | 36.1% |
| 5 | Ramp Dragon | 53.70% | Forest 25.0% |
| 6 | Evolution Haven | 31.71% | Dragon 12.5% |
| 7 | Calgidensula Witch | 18.29% | Forest 1.4% |
凡是“现在下强牌、现在解场、现在打脸”通常也不会破坏未来的卡组,目前AI就比较会玩。需要用当前tempo交换两三回合后爆发的卡组则更困难,因此得到“无脑互殴排名”这个非常不学术、却意外有解释力的名字。
8. 人类比赛里,巫师像住在另一个宇宙
2026年8月8日Dexel Rising Cup #2共有64队、192人、提交384套卡组。魔手巫师有116套,约占30.2%,明显第一;AF疾走Portal 52、进化主教34、协作进化皇家29、Ramp Dragon 25。
人类高端环境把魔手巫师视为顶级meta;AI直接7×7中的Calgidensula Witch却只有18.29%,排名最后。两者不能直接假设是完全相同的40张牌,但“人类很强、现AI不会玩”的落差非常巨大。
Rally Sword则在人类与AI两边都强。于是出现一个粗糙但实用的推论:简单AI也强+高手也强,可能代表对操作失误较有容忍度。
9. Future Optionality全面审计
7个leader、24个mechanics被拆成RULE、STATE、VISIBILITY、IMMEDIATE VALUE、FUTURE VALUE、SEQUENCE、SEARCH、PLAN八层。
27,810个decision、118,575个root candidate中,只有8,878个——7.49%——带有明确future value。24/24的rule、state与immediate value都SUPPORTED,但sequence有23/24 MISSING,plan有20/24 MISSING。
结论非常直接:AI知道规则,也懂“现在赚不赚”,但几乎没有顺序与长期计划。
10. 巫师:知道Spellboost存在,不等于理解Spellboost
Spellboost的rule/state存在,但visibility与future value为PARTIAL,sequence/plan为MISSING。尤其DRAW → SPELL与SPELL → DRAW会产生不同未来:先抽到的牌可能吃到后续boost,后抽到的牌不会回头补上已经发生过的boost。
12个synthetic fixture中,DRAW_FIRST_BETTER=4、SPELL_FIRST_BETTER=0、EQUIVALENT=8。50个实际代表state的总结为STATE_DEPENDENT。所以正确方向不是新增“永远先抽牌”的无脑规则,而是抽到之后重新规划。
11. 龙:PP+1买的是未来行动权
Ramp现在可能亏场面,但max PP+1会解锁下回合更高费牌、多牌组合、回复、解场与终结手段。尤其6→7会跨过Awakening门槛。
Future Optionality审计记录了Dragoncraft MYOPIC_REVERSAL共12件:ramp 6+Awakening 6。即时control原本较高,但t+2 diagnostic continuation有时会反转排名。
当然不能因此hard-code“ramp +10”,否则只是发明另一种笨AI。
12. 其他五个职业也有同一种疾病的变体
Forest有combo threshold、低费生成与bounce顺序;Sword有Rally 9→10与multi-summon;Abyss有Shadows、reanimate pool内容与HP资源;Haven有Countdown与Act,其中“现在不用”本身就是保留未来选择;Portal的0费token与copy会让同回合sequence space爆炸。
EP、SEP、Extra PP、9张手牌上限、5个场位、5个leader area槽位,也都是“现在花掉”与“保留未来选择权”之间的交换。
13. 于是我们真的做了三回合closed-loop planner
新planner强制实际推进至少三个future turn boundary,不是三个action,也不是三张牌。同时不固定三回合脚本:只执行一个action,观察draw、generation、random结果,再从新state重新计算三回合。结构接近Receding Horizon / Model Predictive Control。
它不偷看未来自己的抽牌顺序,也不看对手真实手牌,而使用belief sampling。FutureRelevantState保存Spellboost、Extra PP、Countdown、Act、Rally、Shadows、destroyed follower pool等公开信息。没有任何fixed optionality、Witch或ramp bonus。
14. 实现成功了,表现往地下室冲
Ablation只有56场actual engine games,但实现完整性很高:3,979 / 3,979 root action全部评估,three-turn completion 100%,hidden-info violation 0;observation replan 81,621次,plan change 35,821次。
然而base/widen相对human-prior-v1为**-37.5pt**,replan/state/robust为**-25.0pt**。所有candidate都突破预先登记的-10pt floor,因此正确判定为REJECT_ACTIVE_UNCHANGED。targeted、balanced broad、market 7×7、final holdout全部NOT_RUN。
我们成功做出一台看得更远、却更有自信地选错未来的AI。
15. 这不代表“三回合已经足够”
被排除的是“implementation根本没有看到三回合”这个疑点,不是“三回合在策略上一定足够”。另外base -37.5→replan -25.0虽然方向有趣,但每个candidate只有8 conditions,不能直接做因果结论。
旧Dragon 12个MYOPIC_REVERSAL用真实三回合engine search重放后,只有1/12真的改成ramp排名更高。旧proxy显然不是ground truth。
新的主要嫌疑人变成:替三回合leaf打分的terminal/leaf evaluator,以及tree中的opponent response model。
16. 下一个问题:“你说这个未来是-150分,那从这里真的打100场会赢几场?”
下一轮不先改weight。先固定每个三回合leaf,把evaluator拆成raw feature→normalization→weight→contribution,特别追查-150级极端值到底是哪个term造成的。
接着从同一个leaf重启32~128次直到terminal,建立empirical win rate。raw score不是概率,因此先做score→probability calibration,再测Brier score、log loss与reliability;排序能力则另外用Spearman、Kendall、same-root argmax accuracy、pairwise concordance与decision regret。
最后让opponent response在human-prior-v1、reference-v5与search-based stress response之间cross-play。如此才能区分:leaf打分错、对手模型错、scale/weight错、state representation不足,或三回合仍然太短。
17. 结论:未来看得见,评分表很可疑
AI已经从“现在什么最强?”进化到“我真的能模拟三回合”,但我们仍不能相信它如何判断看见的未来是好是坏。
旅程从皇家79.8%开始,经历人类建议反向优化、巫师崩坏、actor bug、46,900场市场分析、Future Optionality审计,最后真的装上三回合预知。
然后它变得更弱。
本来只想疾走打脸,下一门课却叫Brier score与leaf-value calibration。这到底是《影之诗》还是研究所?
数据附录
- Set 8 card DB: 826
- baseline: 12,480 games
- policy research: 31,406 actual engine games
- status:
PAUSED_COMPLETE_NO_PROMOTION - active:
human-prior-v1 - market: 52 decks / 25 archetypes / 7 leaders
- market analysis: 46,900 games
- direct 7×7: 1,512 games
- optionality audit: 27,810 decisions / 118,575 candidates / 7.49%
- sequence MISSING 23/24; plan MISSING 20/24
- Dragon reversals: 12 = ramp 6 + Awakening 6
- RH3 Ablation: 56 games
- root coverage: 3,979/3,979; completion 100%
- replans: 81,621; plan changes: 35,821
- result:
REJECT_ACTIVE_UNCHANGED - final holdout:
NOT_RUN
参考资料
- Shadowverse: Worlds Beyond官方Deck Portal与职业机制页
- Dexel Rising Cup #2环境报告
- Silver & Veness (2010), POMCP
- Cowling, Powley & Whitehouse (2012), ISMCTS
- Model Predictive Control / Receding Horizon Control
- Brier score、reliability与clustered validation研究
