本来以为要手工录入826张卡,结果半天就开始有“研究所”了

阅读功能说明

收听会朗读正文;速读会按顺序显示短语,速度可调。语言练习可对照已有的不同语言版本。收藏保存在本浏览器中,可从播放器的收藏列表再次打开。

分享这篇文章

分享这篇文章

广告
广告

一想到卡牌模拟器,最恐怖的画面就是一张一张录卡:名称、费用、身材、效果、特殊处理,然后重复几百次。

但如果卡牌数据已经是JSON等结构化格式,而且还有可用的开源对战引擎,工作性质就完全变了。数据批量读取,常见效果复用已有规则,只需要处理真正的新机制。

在这个案例里,Beyond Decks已经有卡牌数据、牌组、seed、replay、Battle Sim、AI和benchmark。

所以不是“重新做游戏”,而是在现成的沙盒上加研究设备和更好的脑子。

1. 把演出全部删掉,一局卡牌游戏快得有点搞笑

真实客户端的时间消耗在抽牌演出、拖卡、语音、进化动画、攻击动画、伤害显示和人类思考。

模拟器基本只有:

状态A
→ 列出合法动作
→ 选动作
→ 更新状态
→ 状态B

循环到有人输。

真正变慢的不是动画,而是你让AI看多远的未来。

2. 底层模拟器不是玩具,而是相当认真的工程

现有系统已经有deterministic seed、replay、目标选择、短期look-ahead、整回合规划、lethal solver、职业机制、benchmark、全卡覆盖审计和runtime检查。

但作者也明确说明:它不是完美的比赛级人类AI,而是中等水平。

这反而很适合研究。规则、棋盘、卡牌、seed、replay和对战机器已经有了,真正值得补的是像人一样判断局面的决策层。

3. 12,480局出现皇家约79.8%——大样本也会放大AI偏科

之前跑完12,480局后,规则覆盖不错,但皇家约79.8%、巫师约25.6%。

不能因为局数多就喊“皇家宇宙第一”。

如果皇家AI只要:

下随从
抢场
脸空了
打脸
赢

就能工作,而复杂牌组AI却:

组件现在能用?用了!
进化现在有收益?用了!
手牌上限?不知道!
三回合以后?未来的我处理!

那结果当然会歪。

大量模拟最大的危险是:把错误策略测得非常精确。

4. 所以加入人类打法知识——不是背答案,而是加入思考习惯

收集并结构化了换牌、保留卡、进化资源、手牌/场面空间、攻守切换、对手强势回合、替代胜法、2~3回合斩杀和常见失误。

但不能硬写“这个对局一定出这张”。

更合理的是:

hold_value +20
future_combo_value +30
opponent_counter_cost +25
过早使用 -40

人类攻略不是答案,而是让搜索方向更合理的偏好。

5. 现在实际跑的是4,032局——2,016是A/B比较条件数

当前设计:

56组 × 2方向 × 18 seed = 2,016 A/B条件

每个条件下,基准策略和人类知识策略各打一局,所以引擎实际处理4,032局。

2,016不是神秘数字,而是两套AI做同一批考试题的数量。

6. 大批量之前先停下来检查

正式跑4,032局之前,先修复“终结卡出得太早”的回归问题,让准备卡在正确条件下先用,再用固定的真实卡库和真实牌表做先后手smoke。

同时检查覆盖率、未支持卡、规则缺口、DB hash、重复ID、引用缺失和知识库版本。

原因很简单:已经见识过AI不对却跑出一万多局的结果。

先确认实验没坏,再谈样本量。

7. human-prior v1还不算真正的临机应变

同一个跳费龙也应该根据局面切换目标。

正常 → 跳费
下回合要死 → 停止跳费,解场/防守
对手资源枯竭 → 进攻
终结卡在手但准备不足 → 保留
准备完成 → 启动终结

“龙要跳费”只是默认策略。真正需要的是每回合重新计算当前最重要的目标。

8. Adaptive AI动态切换 ATTACK / SURVIVE / SETUP / RESOURCE / LETHAL

下一阶段可以根据血量、场面、手牌、PP、进化资源、对手压力、预计伤害、组合技完成度来给几个模式打分。

如果自己6血,对手场上14点伤害,没有保护,那么SURVIVE必须压过RESOURCE。

临机应变不是“六回合前禁止这张卡”,而是不断比较现在用和以后用哪个更值。

9. 看2~3回合未来,但用人类知识剪枝

完全展开游戏树会爆炸。

所以:

50个合法动作
→ 人类先验缩到20
→ 快速评分缩到10
→ 只搜索前10个的2~3回合未来

当前+8但下回合必死的行动,应输给当前+3但能活下来并反击的行动。

10. 直接看对手手牌就是作弊——用“可能有”来思考

不能给AI透视。

应该根据职业、原型、已经用过的卡、剩余牌库、手牌数量和之前动作来构造多个可能世界。

有AOE 30%
没有AOE 70%

在多个可能手牌下评估同一动作。

这样就能接近人类的:“他可能有,所以要防一点,但不能什么都防。”

11. 顺序很重要——当前4,032局中途不能换AI

如果跑到一半突然加入Adaptive v2,前后就不是同一个实验了。

正确流程:

固定human-prior v1
→ 跑完4,032
→ 分析剩余失误
→ Adaptive v2
→ quick A/B
→ 再跑约2,016条件
→ 12k级full
→ 优化40张
→ 对局诊断

v2应该针对真实失败来做,而不是“听起来聪明的功能全塞进去”。

12. 终点不是“背攻略的CPU”,而是“必要时敢违背攻略的CPU”

组合人类知识、游戏树、未来评分、隐藏手牌概率和动态目标。

这样AI才能做到:

“平时跳费,但要死就解场。” “平时保留,但现在有斩杀就全交。” “平时铺场,但怀疑AOE就留一点。”

攻略只是参考,局面才是最终裁判。

13. 这套方法不只适用于一款游戏——不要重做游戏,做“赢的实验室”

宝可梦可以复用现成模拟器研究队伍、选出、换人和招式。卡牌游戏则研究构筑、换牌、资源和对局策略。

重做游戏和研究如何获胜,是两件事。

有可靠模拟器,就借。

不用重建赛场,只要建一个能研究如何赢的实验室。

如果皇家又接近80%,先别加冕。

先看看这机器人是不是又只会“下怪打脸”。


分享这篇文章

广告

查找其他文章

所有文章

Mendoi-chan

作者

Mendoi-chan

把工作与日常生活中的麻烦整理成清晰的结构和下一步行动。

关于本站
广告

最新文章

  1. 1Zero撤退的那一刻,黑色骑士团也该撤了|藤堂与“过度依赖Zero”的组织极限
  2. 2从第一季第25话等到R2:实时追番观众的地狱|枪口悬念之后,R2又像从“记忆被改写”开始
  3. 3蓝月亮,并不是蓝色的月亮
  4. 4为什么 Niconico 动画的评论,会带来一个人看时笑不出来的笑点
  5. 5“明明回复了,却被说成‘你根本不回’”——当聊天引擎被外包给一个人,会发生什么

推荐阅读

广告