给“无脑AI”装上三回合预知后,它反而更弱了——《影之诗:超凡世界》46,900场市场模拟与独立AI研究揭示的“看得见未来,却不会给未来打分”问题

题材:《Shadowverse: Worlds Beyond》

最初的问题很简单:现在什么卡组最强?收集公开卡组,固定规则,让CPU互殴几万场,最后看排名就好。

阅读功能说明

收听会朗读正文;速读会按顺序显示短语,速度可调。语言练习可对照已有的不同语言版本。收藏保存在本浏览器中,可从播放器的收藏列表再次打开。

分享这篇文章

分享这篇文章

广告
广告

1. 本来只想疾走打脸,结果长出了一座研究所

最初的问题很简单:现在什么卡组最强?收集公开卡组,固定规则,让CPU互殴几万场,最后看排名就好。

现实很快给了一拳:能正确执行规则的AI,不等于会打牌的AI。 Set 8固定了826张卡、engine commit、environment hash、合法卡组和seed。历史baseline 12,480场已经做到rule coverage 100%、unsupported 0、rule gap 0,但原始AI仍给出皇家约79.8%、精灵63.7%、龙60.9%、巫师25.6%的异世界成绩。

把错误重复一万次不会变成真理,只会制造一台非常稳定地犯错的机器。

2. 加入人类经验后,AI变弱了

human-prior-v1加入了保留关键资源、尊重setup、保存进化资源等常见经验。exact A/B包含2,016 paired units与4,032 engine games。baseline为50.99%,human-prior-v1为49.36%,下降-1.64pt。

AI听了人类建议,成绩反而更差。

原因在于人类建议有上下文。“留牌”在这回合不用就会死时当然不成立;“抢场”也不意味着摧毁唯一的combo路线。固定权重保留了句子,却杀死了条件。

3. Adaptive v2提高平均值,却把巫师打坏了

Adaptive v2在LETHAL、SURVIVE、STABILIZE、SETUP、RESOURCE、PRESSURE等目标间切换,并加入浅层搜索、隐藏手牌近似与future value。整体比v1高+0.74pt,但Runecraft下降-6.25pt,突破预注册leader floor -5pt,因此REJECT。

后续T11对v1为+0.30pt,但对reference-v5为-2.38pt,Abyss更是-16.67pt,再次REJECT。

平均分看着及格,打开答卷发现一门课在燃烧。

4. 做根因分析时,研究人员先被抓了

发现过一个真实实现缺陷:配置了max_nodes=160却没有真正接到planner,9,067个decision超过名义上限。但接好后广泛胜率仍未改善。

更大的事故是actor attribution。一项被标成“loss→win”的干预其实按fixed player视角统计;从真正改变行动的actor视角看,结果是win→loss。研究员把受害者当成犯人抓了。

actor、direction与invariant修复后,分析平台更可靠了,但AI性能真凶仍然在逃。

5. 31,406场后,“还不知道”成为正式结论

Set 8策略研究最终包含20项实验、31,406场确认的actual engine games。439个discordant units中,完整因果解释性能原因的为0,部分解释11,未解决428。

研究以PAUSED_COMPLETE_NO_PROMOTION结束,active仍为human-prior-v1,原定8,064场final unseen holdout完全没有使用。

成果不是“超级AI”,而是不会因为某张漂亮图表就错误晋升AI的研究装置。

6. 接着让52套市场卡组打了46,900场

市场corpus包含52 decks、25 archetypes、7 leaders。quick、broad、1~3张局部优化、unseen-seed排名与guide trace合计形成46,900场actual engine games。

最后7套推荐卡组再进行直接round robin:21 unordered pairs、1,512 games,每个非对角cell 72场,reference-v5与human-prior-v1各756场,先后手各756场。coverage 100%,unsupported、rule gap、hidden-info violation全部为0。

7. “无脑互殴排名”诞生

排名 推荐卡组 直接7×7平均 最差对局
1 Buff Forest 71.99% Abyss 59.72%
2 Rally Sword 65.97% Forest 31.94%
3 Midrange Abyss 54.17% 40.3%
4 Artifact Portal 54.17% 36.1%
5 Ramp Dragon 53.70% Forest 25.0%
6 Evolution Haven 31.71% Dragon 12.5%
7 Calgidensula Witch 18.29% Forest 1.4%

凡是“现在下强牌、现在解场、现在打脸”通常也不会破坏未来的卡组,目前AI就比较会玩。需要用当前tempo交换两三回合后爆发的卡组则更困难,因此得到“无脑互殴排名”这个非常不学术、却意外有解释力的名字。

8. 人类比赛里,巫师像住在另一个宇宙

2026年8月8日Dexel Rising Cup #2共有64队、192人、提交384套卡组。魔手巫师有116套,约占30.2%,明显第一;AF疾走Portal 52、进化主教34、协作进化皇家29、Ramp Dragon 25。

人类高端环境把魔手巫师视为顶级meta;AI直接7×7中的Calgidensula Witch却只有18.29%,排名最后。两者不能直接假设是完全相同的40张牌,但“人类很强、现AI不会玩”的落差非常巨大。

Rally Sword则在人类与AI两边都强。于是出现一个粗糙但实用的推论:简单AI也强+高手也强,可能代表对操作失误较有容忍度。

9. Future Optionality全面审计

7个leader、24个mechanics被拆成RULE、STATE、VISIBILITY、IMMEDIATE VALUE、FUTURE VALUE、SEQUENCE、SEARCH、PLAN八层。

27,810个decision、118,575个root candidate中,只有8,878个——7.49%——带有明确future value。24/24的rule、state与immediate value都SUPPORTED,但sequence有23/24 MISSING,plan有20/24 MISSING。

结论非常直接:AI知道规则,也懂“现在赚不赚”,但几乎没有顺序与长期计划。

10. 巫师:知道Spellboost存在,不等于理解Spellboost

Spellboost的rule/state存在,但visibility与future value为PARTIAL,sequence/plan为MISSING。尤其DRAW → SPELL与SPELL → DRAW会产生不同未来:先抽到的牌可能吃到后续boost,后抽到的牌不会回头补上已经发生过的boost。

12个synthetic fixture中,DRAW_FIRST_BETTER=4、SPELL_FIRST_BETTER=0、EQUIVALENT=8。50个实际代表state的总结为STATE_DEPENDENT。所以正确方向不是新增“永远先抽牌”的无脑规则,而是抽到之后重新规划。

11. 龙:PP+1买的是未来行动权

Ramp现在可能亏场面,但max PP+1会解锁下回合更高费牌、多牌组合、回复、解场与终结手段。尤其6→7会跨过Awakening门槛。

Future Optionality审计记录了Dragoncraft MYOPIC_REVERSAL共12件:ramp 6+Awakening 6。即时control原本较高,但t+2 diagnostic continuation有时会反转排名。

当然不能因此hard-code“ramp +10”,否则只是发明另一种笨AI。

12. 其他五个职业也有同一种疾病的变体

Forest有combo threshold、低费生成与bounce顺序;Sword有Rally 9→10与multi-summon;Abyss有Shadows、reanimate pool内容与HP资源;Haven有Countdown与Act,其中“现在不用”本身就是保留未来选择;Portal的0费token与copy会让同回合sequence space爆炸。

EP、SEP、Extra PP、9张手牌上限、5个场位、5个leader area槽位,也都是“现在花掉”与“保留未来选择权”之间的交换。

13. 于是我们真的做了三回合closed-loop planner

新planner强制实际推进至少三个future turn boundary,不是三个action,也不是三张牌。同时不固定三回合脚本:只执行一个action,观察draw、generation、random结果,再从新state重新计算三回合。结构接近Receding Horizon / Model Predictive Control。

它不偷看未来自己的抽牌顺序,也不看对手真实手牌,而使用belief sampling。FutureRelevantState保存Spellboost、Extra PP、Countdown、Act、Rally、Shadows、destroyed follower pool等公开信息。没有任何fixed optionality、Witch或ramp bonus。

14. 实现成功了,表现往地下室冲

Ablation只有56场actual engine games,但实现完整性很高:3,979 / 3,979 root action全部评估,three-turn completion 100%,hidden-info violation 0;observation replan 81,621次,plan change 35,821次。

然而base/widen相对human-prior-v1为**-37.5pt**,replan/state/robust为**-25.0pt**。所有candidate都突破预先登记的-10pt floor,因此正确判定为REJECT_ACTIVE_UNCHANGED。targeted、balanced broad、market 7×7、final holdout全部NOT_RUN。

我们成功做出一台看得更远、却更有自信地选错未来的AI。

15. 这不代表“三回合已经足够”

被排除的是“implementation根本没有看到三回合”这个疑点,不是“三回合在策略上一定足够”。另外base -37.5→replan -25.0虽然方向有趣,但每个candidate只有8 conditions,不能直接做因果结论。

旧Dragon 12个MYOPIC_REVERSAL用真实三回合engine search重放后,只有1/12真的改成ramp排名更高。旧proxy显然不是ground truth。

新的主要嫌疑人变成:替三回合leaf打分的terminal/leaf evaluator,以及tree中的opponent response model。

16. 下一个问题:“你说这个未来是-150分,那从这里真的打100场会赢几场?”

下一轮不先改weight。先固定每个三回合leaf,把evaluator拆成raw feature→normalization→weight→contribution,特别追查-150级极端值到底是哪个term造成的。

接着从同一个leaf重启32~128次直到terminal,建立empirical win rate。raw score不是概率,因此先做score→probability calibration,再测Brier score、log loss与reliability;排序能力则另外用Spearman、Kendall、same-root argmax accuracy、pairwise concordance与decision regret。

最后让opponent response在human-prior-v1、reference-v5与search-based stress response之间cross-play。如此才能区分:leaf打分错、对手模型错、scale/weight错、state representation不足,或三回合仍然太短。

17. 结论:未来看得见,评分表很可疑

AI已经从“现在什么最强?”进化到“我真的能模拟三回合”,但我们仍不能相信它如何判断看见的未来是好是坏。

旅程从皇家79.8%开始,经历人类建议反向优化、巫师崩坏、actor bug、46,900场市场分析、Future Optionality审计,最后真的装上三回合预知。

然后它变得更弱。

本来只想疾走打脸,下一门课却叫Brier score与leaf-value calibration。这到底是《影之诗》还是研究所?

数据附录

  • Set 8 card DB: 826
  • baseline: 12,480 games
  • policy research: 31,406 actual engine games
  • status: PAUSED_COMPLETE_NO_PROMOTION
  • active: human-prior-v1
  • market: 52 decks / 25 archetypes / 7 leaders
  • market analysis: 46,900 games
  • direct 7×7: 1,512 games
  • optionality audit: 27,810 decisions / 118,575 candidates / 7.49%
  • sequence MISSING 23/24; plan MISSING 20/24
  • Dragon reversals: 12 = ramp 6 + Awakening 6
  • RH3 Ablation: 56 games
  • root coverage: 3,979/3,979; completion 100%
  • replans: 81,621; plan changes: 35,821
  • result: REJECT_ACTIVE_UNCHANGED
  • final holdout: NOT_RUN

参考资料

  • Shadowverse: Worlds Beyond官方Deck Portal与职业机制页
  • Dexel Rising Cup #2环境报告
  • Silver & Veness (2010), POMCP
  • Cowling, Powley & Whitehouse (2012), ISMCTS
  • Model Predictive Control / Receding Horizon Control
  • Brier score、reliability与clustered validation研究

分享这篇文章

广告

今天读这篇

每一篇都回答读完本文后常有的下一个问题。

浏览全部文章更多「卡牌与桌游」文章

查找其他文章

所有文章

Mendoi-chan

本站运营者

Mendoi-chan

把工作与日常生活中的麻烦整理成清晰的结构和下一步行动。

广告

最新文章

  1. 1偷内衣的神父会被抓,“播种大叔”却是英雄?漫画删掉最挑受众的癖好,原作甚至觉醒《想象怀孕》
  2. 2人类,这个真打不过——把《PRAGMATA》当月球美术馆逛着逛着,我开始对机器文明的工业产能绝望了
  3. 3为什么我的攻击总是输?——焰/光玩家,被一八的无形判定和鳄鱼肚皮整破防
  4. 4给不擅长一个人行动的人:拆解“没人陪就动不了”,培养你的“独处行动 OS”
  5. 5月面基地还没坏完,我的操作系统先崩了

推荐阅读

广告