1. 本来只想疾驰打脸,结果建了实验室
目标原本只是用AI找当前最强卡组。固定Set 8、826张卡数据库、engine commit、环境hash、合法卡组与seed。历史基准12,480局达到rule coverage 100%、unsupported 0、rule gap 0,但原始AI仍给出Sword约79.8%、Rune约25.6%的异世界成绩。
重复一万次不会自动变成真理,也可能只是高速重复同一个误会。
2. 加入人类经验反而变弱,平均值也会骗人
human-prior-v1 exact A/B为2,016 paired units / 4,032 games,baseline 50.99%,新策略49.36%,-1.64pt。Adaptive v2整体+0.74pt,但Runecraft -6.25pt触发leader floor而REJECT;T11也因Abysscraft -16.67pt等失败。
人类建议有条件,固定weight却容易杀死上下文。平均合格不代表每个leader都没着火。
3. 根因分析先抓到了研究系统自己的bug
发现max_nodes=160没有真正接入planner,以及actor与fixed-player视角混淆导致因果方向反转。平台bug修复后,广泛性能仍未恢复。
Set 8策略研究在20个实验、31,406 confirmed engine games后以PAUSED_COMPLETE_NO_PROMOTION结束。439个discordant units中完整解释0、部分解释11、未解决428。active保持human-prior-v1,8,064局final unseen holdout继续封存。
4. 52套市场卡组打46,900局,诞生“脑死互殴榜”
市场corpus为52 decks / 25 archetypes / 7 leaders,市场分析46,900局;另有推荐7套直接7×7共1,512局。平均:Buff Forest 71.99%、Rally Sword 65.97%、Midrange Abyss 54.17%、Artifact Portal 54.17%、Ramp Dragon 53.70%、Evolution Haven 31.71%、Calgidensula Witch 18.29%。
这些是simulator-direct,不是天梯胜率。越是“现在强=以后也强”的卡组,当前AI越好操作;需要暂时吃亏换未来爆发的卡组越难。
5. 人类比赛里的Witch像在另一个宇宙
2026-08-08 Dexel Rising Cup #2共384份卡组,Hand Witch 116份,约30.2%,为最多。AI直接7×7的Calgidensula Witch却只有18.29%,最后一名。不能假设两者是同一40张,但人类与AI对Witch的使用差距明显。
Rally Sword在人类和AI两边都强,也支持一个实用假设:对错误操作更耐受的策略可能更适合普通玩家。
6. Future Optionality审计:规则懂,顺序和计划几乎没有
审计7 leaders / 24 mechanics的RULE、STATE、VISIBILITY、IMMEDIATE VALUE、FUTURE VALUE、SEQUENCE、SEARCH、PLAN。27,810 decisions / 118,575 root candidates中只有8,878个、7.49%具有明确future value。rule/state/immediate为24/24 supported,但sequence 23/24 MISSING、plan 20/24 MISSING。
Witch的抽牌顺序、Dragon的PP与Awakening都说明“未来选择权”很重要。Dragon的12个MYOPIC_REVERSAL诊断= ramp 6 + Awakening 6,但没有硬编码成奖励。
7. 真正实现三回合closed-loop planner
至少推进3个future turn boundaries,每次只执行一个action,观察draw/random/opponent action后重新规划,不偷看hidden hand或future draw order。
56局Ablation中root action 3,979/3,979,3-turn completion 100%,hidden-info 0,replans 81,621,plan changes 35,821。实现成功,但对human-prior-v1性能-25.0到-37.5pt。看得更远,也错得更远。
8. leaf calibration把排序崩坏拆开
捕捉3,979 root-action leaves、1,009 unique leaves,生成54,208 terminal rollout rows。73个first divergence中leaf weighting 59、chance aggregation 12、opponent backup 2。
问题不只是horizon短,更可能是“到达未来后怎么评分”。旧Dragon 12个proxy在真实三回合search里只有1/12真正向ramp改序,再次证明proxy不是ground truth。
9. learned value预测更准,却更不会选第一名
fresh holdout v1.1:7 leaders,727 leaves / 104 roots / 22,768 terminal rollouts。Brier 0.1144→0.0972,pairwise 75.7→78.9%改善。
但root argmax 59.6→39.4%,top2 73.1→64.4%,top3 82.7→76.0%,mean regret 4.42→5.29pt,Forest/Haven/Portal floor失败。状态HOLD_OFFLINE。
预测概率好看,不等于会按下正确的卡。
10. 改成从lethal反向推理
用LETHAL ← damage ← PP ← cards ← Spellboost/Awakening/Rally threshold ← current action构造goal regression。Ramp不是因为“+8分”才有价值,而是某条实际胜路需要按时达到8PP。
先从目标向后生成条件,再用真实engine向前验证是否真的能走通。
11. 也从自己的死亡反推
从SELF_LOSS反推对手所需伤害、场面伤害、手牌追加伤害、Ward处理、PP与公开信息,并判断当前action切断了哪些对手胜路。
不能只优化安全,否则AI会一边回血一边礼貌地输。RISK_REQUIRED允许在安全路线几乎必败时,选择仍保留最高真实胜率的非forced-loss风险路线。
12. “强制”必须标明证明范围
胜方标签:PROVEN_WIN_NOW、FORCED_WIN_FULLY_OBSERVABLE_SUBTREE、FORCED_WIN_WITHIN_ENUMERATED_RESPONSE_SET、ROBUST_WIN_BELIEF、CONDITIONAL_WIN。败方同样区分proof、belief与conditional。
proof search中self=OR、opponent=AND;对chance宣称确定必须覆盖所有reachable outcomes。禁止偷看hidden hand truth、future draw order和strategy fusion,只能在观察后replan。
13. action优先级改成分层gate
顺序:proven win now → fully observable forced → enumerated forced → 删除可避免的proof-level forced loss → 最大expected final win probability → near-tie safety → robustness → route progress/cut → validated continuation value。
belief/conditional win不是forced。只有胜率更低且loss risk更高的action才可作为strictly dominated删除。
14. 三回合是最低距离,不是墙
初始设定H_MIN=3、selective H_MAX=5。只有lethal、forced response、重要threshold、delayed payoff或near tie未解决的branch延长。
rollout从32/candidate开始,模糊的top候选追加64→128→256。root分UNIQUE_BEST / PRACTICAL_TIE / UNRESOLVED,epsilon 0.02/0.03/0.05仅在development比较,新holdout前冻结。
15. 新QC:先抓自信满满的错误,再谈最强AI
Primary要求hidden-info、future-draw、rule gap、strategy fusion、false proven、forced scope mislabel、chance completeness violation、lethal miss、avoidable forced loss、leakage全部为0。之后检查7 leader coverage、argmax、mean/p90/p95 regret、leader floors、top2 best-set。
Brier/pairwise/calibration只是Secondary,不能救Primary失败。v1.1 holdout永久消费,不再用于训练或调参。
给AI未来,它变弱;教它胜率,预测变好但最佳动作变差。因此下一步同时从胜利与失败反推,并只把真正被证据范围支持的结果叫“强制”。
用AI造最强AI。现在QC可能比游戏AI更强——这反而是好事。
