1. 结论:麻将 AI 不是让胜率暴涨的魔法,而是积累几个百分点的机器
四人麻将中,如果四个人实力完全相同,第一名概率的起点就是25%。这是第一个残酷事实。
强者或强 AI 并不会把第一率轻松拉到50%。高水平的差距通常更小:多几个百分点的一位、少几个百分点的四位、稍低的放铳率,以及能根据分数、局数、庄家身份和手牌价值改变判断。
所以高水平麻将不像放必杀技,更像在多米诺工厂上班:留一张安全牌,该推的好型听牌就推,不为便宜烂手硬拼,终局按名次条件行动。每次都很小,几百个半庄之后,段位系统全记账。
但研究上必须加一句:目前没有可靠的因果研究证明“用 AI 复盘一定让某个普通玩家的一位率提高 X 个百分点”。AI 本身有多强,和 AI 教学能让人提高多少,是两个不同问题。
2. 四人麻将残酷的25%基准
四名对称玩家的各名次平均都是25%。因此“真正的高手应该一半对局拿第一”并不是正确模型。
麻将有大量隐藏信息:别人的手牌、牌山、未来摸牌,而且还有三名对手。正确判断也会输,错误判断有时也能胡。
因此实力更应该看长期名次分布和决策质量,而不是今天有没有拿第一。
“今天没一位,所以打法坏了”差不多等于看一下午的天气就给全球气候下结论。
3. Suphx:第一率约30%已经强得离谱
Microsoft Research 的 Suphx 是深度强化学习麻将 AI 的代表研究。论文评估中,它在天凤特上桌打了5,760个半庄,稳定段位达到8.74;论文中的顶尖人类对照组为7.46。
论文 Table 5 报告:
| 指标 | Suphx | 顶尖人类 | 爆打 | NAGA |
|---|---|---|---|---|
| 一位率 | 29.3% | 28.0% | 28.0% | 25.6% |
| 四位率 | 18.7% | 20.5% | 22.4% | 21.1% |
| 和牌率 | 22.83% | - | 23.07% | 22.69% |
| 放铳率 | 10.06% | - | 12.16% | 11.42% |
重点不只是29.3%。Suphx同时有表中最高的一位率、最低的四位率和最低的放铳率。
这直接否定了“想多拿第一就一定得多吃第四”的简单交换关系。更好的策略可以同时改善两端。
Suphx还使用 Global Reward Prediction(全局奖励预测),把眼前一局的行为和整场半庄的最终回报联系起来。当前这手牌看起来赚不赚,并不等于整场比赛的最优选择。
需要强调:这是天凤数据,不是雀魂数据。段位分、玩家池和环境不同,所以29.3%不能直接当成雀魂目标线。
4. 高段位是多米诺师傅的工厂
初学阶段,只要学会牌效率就可能提升很大。到了上位区,别人也已经拿走了这些“免费分”。
剩下的是更细的差别:什么时候留安全牌,好型和打点如何取舍,对手立直后推到第几巡,一向听值不值得战,庄家该承担多少风险,南场第二名该追第一还是保顺位。
一次看起来很小,重复500次就不小。
高段位就是一个嘲笑0.5%的人会被期望值慢慢埋掉的文明工厂。
5. 太依赖 AI,就会诞生“完全不懂规则的 AI 操作员”
“切哪张?”→问AI。
“要不要鸣?”→问AI。
“听什么?”→问AI。
“这是什么役?”→AI说能和。
成绩可能先提高,但理解不一定跟上。你学会的也许不是麻将,而是麻将 AI 的操作方法。
心理学把利用外部工具降低内部思考负担称为 cognitive offloading(认知卸载)。Risko 与 Gilbert 的综述指出,外部化能降低认知负担,也会带来认知层面的后果。
2025年一项含120名大学生的随机对照试验还发现,无限制使用 ChatGPT 辅助学习的组在45天后的知识保持测试中低于传统学习组。这不是麻将实验,因此不能直接证明麻将 AI 会妨碍学习。但它提醒我们:把答案外包,不等于大脑自动学会生成答案。
就像一路抄攻略打到最终 Boss,结果突然通知你:现在考试,范围是新手教程。
6. “拿不到第一,但也很少第四”到底是什么意思?
单凭这个现象无法确定原因。至少有四种假设。
- 防守过度:连值得承担的风险也放弃,名次压缩到二三位。
- 进攻质量问题:立直、鸣牌、速度或打点选择没有转化成第一。
- 顺位条件问题:南场、终局没有正确抓住从第二冲第一的机会。
- 纯波动:打法没变,只是最近样本里第一更少。
所以“第四率低=你太怂”并不是研究级诊断。
7. 研究角度不能仅凭名次率断言“防守过度”
汇总指标存在识别问题:同一个结果可以由不同机制产生。
例如一位20%、四位15%,既可能来自过度弃和,也可能是高打点机会运气差、终局条件判断弱,或者只是100局左右的随机波动。
Suphx本身也打破了“防得好就拿不到第一”的简单故事。它防铳率和四位率都很低,却同时拿到了比较表中最高的一位率。
真正想诊断过度防守,需要看条件化行为:巡目、向听数、等待质量、手牌价值、庄家与否、当前顺位、对手是否立直,以及最终到底推了还是撤了。
8. 100个半庄的低迷完全可能只是噪声
假设真实一位率为25%,再非常粗略地把每个半庄当作独立伯努利试验,则近似95%误差范围约为:
| 半庄数 | 25%附近的近似95%误差 |
|---|---|
| 100 | 约 ±8.5个百分点 |
| 500 | 约 ±3.8个百分点 |
| 1,000 | 约 ±2.7个百分点 |
因此100个半庄里一位率只有20%,并不足以证明策略坏了。
真实雀魂当然不是完全独立同分布:对手、段位、规则和自己的水平都会变化。这个表不是精确模型,只是让人感受短期战绩能抖多大。
麻将方差最喜欢等你说“100局够多了吧”,然后从背后拍你肩膀。
9. 让 AI 重新当老师:拿走理由,而不只是答案
更好的复盘流程是:
- 看 AI 前先写下自己的选择。
- 再和 AI 候选比较。
- 让 AI 用一句简单的话解释“为什么”。
- 问反转条件:“什么条件改变后,反过来的选择才正确?”
- 给错误分类:牌效率、防守、攻守判断、打点、鸣牌、立直、顺位条件。
- 优先复习重复出现的错误,而不是无限收集新技巧。
最值得看的通常是放铳局、立直攻守临界点、鸣/不鸣、和 AI 分歧很大的局,以及南场和终局的顺位战。
雀魂的 MAKA 可以分析四人段位战牌谱,显示评价和建议。放在对局后使用,它最有价值的地方不是替你答一道题,而是找出你重复犯的同一类错。
10. 应该检查哪些战绩指标
| 指标 | 能看出什么 |
|---|---|
| 1/2/3/4位率 | 名次集中在哪里 |
| 和牌率 | 把手牌转化为和牌的频率 |
| 放铳率 | 防守风险与损失 |
| 立直率 | 门清听牌转化为压力/价值的程度 |
| 副露率 | 用鸣牌换速度、役种的倾向 |
| 平均和牌打点 | 和牌的质量而非数量 |
| 庄家/闲家拆分 | 是否吃到庄家价值 |
| 南场/终局拆分 | 顺位管理能力 |
如果能进一步按巡目、向听、等待质量、打点、对手立直、庄家身份和当前点差分析攻守,诊断会强很多。
这时,“最近没第一”才终于变成可以分析的数据问题。
11. 实时 AI 代打是另一回事:把 AI 用在赛后牌谱复盘
用 AI 学习和在段位战中让外部工具替你选牌不是一回事。
雀魂官方公告把使用外部工具以及破坏公平性的行为列为违规示例,并提示可能采取账号停止等措施。
最清楚的原则就是:对局自己打,结束后用允许的牌谱系统、MAKA等工具复盘。
否则最后会出现稀有职业:高段位,规则内存为零。役?问AI。点数?服务器知道。
12. 总结:去堆那2%的多米诺
- 同水平四人麻将的一位基准是25%。
- Suphx级别也只是约30%一位,而不是50%。
- 好策略可以同时增加第一、减少第四。
- “第一少+第四少”不能单独证明防守过度。
- 短样本的名次率波动很大。
- 过度把思考外包给 AI,可能让成绩和理解分离。
- 不只问 AI “打什么”,还要问“为什么”和“什么条件会让答案反转”。
上位麻将就是积累细小优势。
多米诺很无聊,但段位表会记住每一块。
13. 参考文献
- Li, J. et al. (2020). Suphx: Mastering Mahjong with Deep Reinforcement Learning. https://arxiv.org/abs/2003.13590
- Microsoft Research. Suphx: The World Best Mahjong AI. https://www.microsoft.com/en-us/research/project/suphx-mastering-mahjong-with-deep-reinforcement-learning/
- 雀魂. AI辅助牌谱分析工具 MAKA. https://mahjongsoul.com/news/254
- 雀魂. 关于违规行为. https://mahjongsoul.com/news/24
- Risko, E. F., & Gilbert, S. J. (2016). Cognitive Offloading. https://doi.org/10.1016/j.tics.2016.07.002
- ChatGPT as a cognitive crutch (2025). https://doi.org/10.1016/j.ssaho.2025.102287
