用AI造最强AI——能看三回合却变弱的影之诗WB AI,开始从胜路、败路和“强制结果”的证明反向推理

题材:《Shadowverse: Worlds Beyond》

重复一万次不会自动变成真理,也可能只是高速重复同一个误会。

阅读功能说明

收听会朗读正文;速读会按顺序显示短语,速度可调。语言练习可对照已有的不同语言版本。收藏保存在本浏览器中,可从播放器的收藏列表再次打开。

分享这篇文章

分享这篇文章

广告
广告

1. 本来只想疾驰打脸,结果建了实验室

目标原本只是用AI找当前最强卡组。固定Set 8、826张卡数据库、engine commit、环境hash、合法卡组与seed。历史基准12,480局达到rule coverage 100%、unsupported 0、rule gap 0,但原始AI仍给出Sword约79.8%、Rune约25.6%的异世界成绩。

重复一万次不会自动变成真理,也可能只是高速重复同一个误会。

2. 加入人类经验反而变弱,平均值也会骗人

human-prior-v1 exact A/B为2,016 paired units / 4,032 games,baseline 50.99%,新策略49.36%,-1.64pt。Adaptive v2整体+0.74pt,但Runecraft -6.25pt触发leader floor而REJECT;T11也因Abysscraft -16.67pt等失败。

人类建议有条件,固定weight却容易杀死上下文。平均合格不代表每个leader都没着火。

3. 根因分析先抓到了研究系统自己的bug

发现max_nodes=160没有真正接入planner,以及actor与fixed-player视角混淆导致因果方向反转。平台bug修复后,广泛性能仍未恢复。

Set 8策略研究在20个实验、31,406 confirmed engine games后以PAUSED_COMPLETE_NO_PROMOTION结束。439个discordant units中完整解释0、部分解释11、未解决428。active保持human-prior-v1,8,064局final unseen holdout继续封存。

4. 52套市场卡组打46,900局,诞生“脑死互殴榜”

市场corpus为52 decks / 25 archetypes / 7 leaders,市场分析46,900局;另有推荐7套直接7×7共1,512局。平均:Buff Forest 71.99%、Rally Sword 65.97%、Midrange Abyss 54.17%、Artifact Portal 54.17%、Ramp Dragon 53.70%、Evolution Haven 31.71%、Calgidensula Witch 18.29%。

这些是simulator-direct,不是天梯胜率。越是“现在强=以后也强”的卡组,当前AI越好操作;需要暂时吃亏换未来爆发的卡组越难。

5. 人类比赛里的Witch像在另一个宇宙

2026-08-08 Dexel Rising Cup #2共384份卡组,Hand Witch 116份,约30.2%,为最多。AI直接7×7的Calgidensula Witch却只有18.29%,最后一名。不能假设两者是同一40张,但人类与AI对Witch的使用差距明显。

Rally Sword在人类和AI两边都强,也支持一个实用假设:对错误操作更耐受的策略可能更适合普通玩家。

6. Future Optionality审计:规则懂,顺序和计划几乎没有

审计7 leaders / 24 mechanics的RULE、STATE、VISIBILITY、IMMEDIATE VALUE、FUTURE VALUE、SEQUENCE、SEARCH、PLAN。27,810 decisions / 118,575 root candidates中只有8,878个、7.49%具有明确future value。rule/state/immediate为24/24 supported,但sequence 23/24 MISSING、plan 20/24 MISSING。

Witch的抽牌顺序、Dragon的PP与Awakening都说明“未来选择权”很重要。Dragon的12个MYOPIC_REVERSAL诊断= ramp 6 + Awakening 6,但没有硬编码成奖励。

7. 真正实现三回合closed-loop planner

至少推进3个future turn boundaries,每次只执行一个action,观察draw/random/opponent action后重新规划,不偷看hidden hand或future draw order。

56局Ablation中root action 3,979/3,979,3-turn completion 100%,hidden-info 0,replans 81,621,plan changes 35,821。实现成功,但对human-prior-v1性能-25.0到-37.5pt。看得更远,也错得更远。

8. leaf calibration把排序崩坏拆开

捕捉3,979 root-action leaves、1,009 unique leaves,生成54,208 terminal rollout rows。73个first divergence中leaf weighting 59、chance aggregation 12、opponent backup 2。

问题不只是horizon短,更可能是“到达未来后怎么评分”。旧Dragon 12个proxy在真实三回合search里只有1/12真正向ramp改序,再次证明proxy不是ground truth。

9. learned value预测更准,却更不会选第一名

fresh holdout v1.1:7 leaders,727 leaves / 104 roots / 22,768 terminal rollouts。Brier 0.1144→0.0972,pairwise 75.7→78.9%改善。

但root argmax 59.6→39.4%,top2 73.1→64.4%,top3 82.7→76.0%,mean regret 4.42→5.29pt,Forest/Haven/Portal floor失败。状态HOLD_OFFLINE。

预测概率好看,不等于会按下正确的卡。

10. 改成从lethal反向推理

用LETHAL ← damage ← PP ← cards ← Spellboost/Awakening/Rally threshold ← current action构造goal regression。Ramp不是因为“+8分”才有价值,而是某条实际胜路需要按时达到8PP。

先从目标向后生成条件,再用真实engine向前验证是否真的能走通。

11. 也从自己的死亡反推

从SELF_LOSS反推对手所需伤害、场面伤害、手牌追加伤害、Ward处理、PP与公开信息,并判断当前action切断了哪些对手胜路。

不能只优化安全,否则AI会一边回血一边礼貌地输。RISK_REQUIRED允许在安全路线几乎必败时,选择仍保留最高真实胜率的非forced-loss风险路线。

12. “强制”必须标明证明范围

胜方标签:PROVEN_WIN_NOW、FORCED_WIN_FULLY_OBSERVABLE_SUBTREE、FORCED_WIN_WITHIN_ENUMERATED_RESPONSE_SET、ROBUST_WIN_BELIEF、CONDITIONAL_WIN。败方同样区分proof、belief与conditional。

proof search中self=OR、opponent=AND;对chance宣称确定必须覆盖所有reachable outcomes。禁止偷看hidden hand truth、future draw order和strategy fusion,只能在观察后replan。

13. action优先级改成分层gate

顺序:proven win now → fully observable forced → enumerated forced → 删除可避免的proof-level forced loss → 最大expected final win probability → near-tie safety → robustness → route progress/cut → validated continuation value。

belief/conditional win不是forced。只有胜率更低且loss risk更高的action才可作为strictly dominated删除。

14. 三回合是最低距离,不是墙

初始设定H_MIN=3、selective H_MAX=5。只有lethal、forced response、重要threshold、delayed payoff或near tie未解决的branch延长。

rollout从32/candidate开始,模糊的top候选追加64→128→256。root分UNIQUE_BEST / PRACTICAL_TIE / UNRESOLVED,epsilon 0.02/0.03/0.05仅在development比较,新holdout前冻结。

15. 新QC:先抓自信满满的错误,再谈最强AI

Primary要求hidden-info、future-draw、rule gap、strategy fusion、false proven、forced scope mislabel、chance completeness violation、lethal miss、avoidable forced loss、leakage全部为0。之后检查7 leader coverage、argmax、mean/p90/p95 regret、leader floors、top2 best-set。

Brier/pairwise/calibration只是Secondary,不能救Primary失败。v1.1 holdout永久消费,不再用于训练或调参。

给AI未来,它变弱;教它胜率,预测变好但最佳动作变差。因此下一步同时从胜利与失败反推,并只把真正被证据范围支持的结果叫“强制”。

用AI造最强AI。现在QC可能比游戏AI更强——这反而是好事。


分享这篇文章

广告

今天读这篇

每一篇都回答读完本文后常有的下一个问题。

浏览全部文章更多「卡牌与桌游」文章

查找其他文章

所有文章

Mendoi-chan

本站运营者

Mendoi-chan

把工作与日常生活中的麻烦整理成清晰的结构和下一步行动。