1. 결론: 마작 AI는 “승률을 폭발적으로 올리는” 마법이 아니다. 몇 %를 쌓는 기계다
4인 마작에서 모두가 같은 실력이라면, 1위를 할 확률의 출발점은 25%다. 여기서부터 이미 잔인하다.
강한 사람이나 강한 AI가 들어온다고 해서 톱률이 50%가 되지는 않는다. 상위권에서는 톱률을 몇 포인트 올리고, 라스율을 몇 포인트 낮추고, 방총을 조금 줄이고, 같은 패 모양이라도 점수 상황에 맞춰 판단을 바꾼다. 그 작은 차이가 수백 반장을 거치며 쌓인다.
쉽게 말해 상위 마작은 거대한 필살기를 쓰는 게임이 아니다.
안전패를 1장 남긴다. 밀어야 할 텐파이는 민다. 싼 손을 무리하게 쫓지 않는다. 오라스에서는 필요한 순위를 잡는다.
이것을 하나씩 쌓는 도미노 공장이다. 그리고 내가 1장을 놓는 동안, 강한 사람들은 조용히 5장쯤 놓고 있다. 레이트가 빡세다.
다만 중요한 주의점이 있다. 연구만으로는 “AI로 공부하면 인간의 톱률이 반드시 +2% 오른다” 같은 인과 효과를 아직 말할 수 없다. 마작 AI 자체의 강함과, AI를 선생님으로 쓴 사람이 얼마나 느는지는 다른 질문이기 때문이다.
2. 4인 마작의 25%라는 잔인한 초기값
4명이 완전히 대칭이라면, 각 순위는 평균 25%다. 그래서 “강자라면 절반은 톱”이라는 감각은 꽤 빗나가 있다.
마작에는 배패, 쯔모, 다른 사람의 손패처럼 보이지 않는 정보가 많다. 불완전 정보 게임이고, 게다가 4인전이다. 좋은 판단을 해도 질 수 있고, 나쁜 판단을 해도 그 한 국만은 이길 수 있다.
그래서 실력은 한 판의 승패보다, 긴 기간의 순위 분포, 방총, 화료, 타점, 국면별 판단에서 드러난다.
“오늘 톱을 못 했다. 약해졌다.”
마작에서는 위험한 진단이다. 오늘 날씨만 보고 지구 온난화를 판단하는 것만큼 표본이 작다.
3. Suphx: 톱 약 30%만 해도 충분히 망가진 성능이다
Microsoft Research의 마작 AI Suphx 는 딥 강화학습으로 일본식 마작을 학습한 대표적인 연구 사례다. 논문에서는 천봉의 특상탁에서 5,760반장을 쳤고, 안정 단위 8.74를 기록했다. 비교 대상인 상위 인간 집단은 7.46이었다.
논문의 Table 5에서 Suphx의 성적은 다음과 같았다.
| 지표 | Suphx | 상위 인간 | 爆打 | NAGA |
|---|---|---|---|---|
| 1위율 | 29.3% | 28.0% | 28.0% | 25.6% |
| 4위율 | 18.7% | 20.5% | 22.4% | 21.1% |
| 화료율 | 22.83% | - | 23.07% | 22.69% |
| 방총률 | 10.06% | - | 12.16% | 11.42% |
여기서 재미있는 점은 Suphx가 “톱을 늘리는 대신 라스도 늘린” 것이 아니라는 점이다. 1위율이 높고, 4위율이 낮고, 방총률도 낮다.
게다가 爆打보다 화료율은 조금 낮다. 즉 “무조건 많이 나는 것”이 답은 아니다.
Suphx에는 각 국뿐 아니라 최종 게임 보상을 예측하는 Global Reward Prediction 같은 구조가 들어 있다. 현재 점수, 국 수, 순위까지 보고, 한 국의 이득과 반장 전체의 이득을 연결하는 생각이다.
다만 이것은 천봉에서의 연구 결과다. 작혼은 단위 포인트나 환경이 같지 않다. 그래서 29.3%라는 숫자를 그대로 작혼의 목표값으로 삼는 것은 너무 대충이다.
4. 상위권은 도미노 장인의 공장이다
초보 구간에서는 패 효율만 배워도 큰 차이가 난다.
- 유효패 수를 늘린다
- 역을 만든다
- 텐파이하면 리치를 검토한다
- 위험패를 조금 외운다
이것만으로도 “나, 마작 좀 늘었나?”가 생긴다.
하지만 상위권으로 가면 주변 사람들도 이미 그 단계를 지나왔다. 그러면 남는 차이는 작다.
- 언제 안전패를 남길까
- 좋은 대기와 타점 중 무엇을 고를까
- 리치에 몇 순까지 밀까
- 1샨텐에서 어디까지 싸울까
- 친 차례에 위험을 얼마나 질까
- 남장에서 2등일 때 톱을 노릴까, 순위를 지킬까
한 번으로는 “그게 그렇게 달라져?” 싶은 차이가 500번, 1000번이면 도미노가 된다.
상위권이란, 0.5%를 비웃은 사람부터 차례로 레이트에 묻히는 공장이다.
5. AI에 너무 맡기면 “룰을 모르는 AI 오퍼레이터”가 된다
AI 학습에는 또 다른 함정이 있다.
“뭐 버려?” → AI에게 묻는다.
“울어?” → AI에게 묻는다.
“무슨 대기야?” → AI에게 묻는다.
“이 역 뭐야?” → AI가 뭔가 날 수 있다고 합니다.
이렇게 성적만 먼저 오르면, 마작 판단을 배운 것이 아니다. 마작 AI 조작법을 배운 사람이 완성된다.
심리학에서는 머릿속에서 해야 할 처리를 바깥 도구에 맡겨 부담을 줄이는 일을 cognitive offloading(인지적 오프로딩) 이라고 부른다. Risko와 Gilbert의 리뷰는, 외부화가 인지 부담을 낮추는 한편 그 사용 방식에는 인지적인 결과가 있다고 정리했다.
또 2025년에 대학생 120명을 대상으로 한 무작위 비교 시험에서는, ChatGPT를 제한 없이 학습 보조로 쓴 집단이 45일 뒤 지식 유지 테스트에서 기존 학습 집단보다 낮은 점수를 받았다. 이것은 마작 연구가 아니므로 직접 증명은 아니다. 하지만 “답을 밖에 맡긴다고 해서, 그 답을 만드는 내부 회로가 자란다고는 할 수 없다” 는 경고로는 꽤 잘 맞는다.
공략 사이트만 보고 최종 보스까지 왔더니, 갑자기 튜토리얼 필기시험이 시작됐다. 대충 이런 상황이다.
6. “톱은 못 하는데, 라스도 안 한다”는 무엇을 뜻할까?
이 증상만으로 원인을 하나로 정할 수는 없다.
생각할 수 있는 가설은 적어도 4가지다.
- 수비 과다: 위험을 너무 피해서, 톱으로 가기 위해 밀어야 할 순간까지 버리고 있다.
- 공격의 질 문제: 화료 횟수가 아니라, 리치, 울기, 타점, 속도 선택에서 톱을 놓치고 있다.
- 순위 조건 문제: 남장이나 오라스에서, 2등에서 1등으로 가는 조건을 충분히 잡지 못하고 있다.
- 그냥 흔들림: 전술은 변하지 않았는데, 단기적으로 톱이 오지 않았을 뿐이다.
그래서 “라스율 낮네요. 너무 지키네요.”라고 바로 단정하는 것은 연구 관점에서는 거칠다.
7. 연구 기준으로는 “수비 과다”라고 바로 말할 수 없다
집계값에는 식별 문제가 있다. 쉽게 말하면, 같은 결과라도 원인이 여러 개일 수 있다는 뜻이다.
예를 들어 톱 20%, 라스 15%라는 성적이 있어도,
- 너무 지켜서 2등, 3등에 몰렸다
- 높은 타점 손만 운 나쁘게 완성되지 않았다
- 오라스 조건전만 약하다
- 단순히 100전 정도의 흔들림이다
어느 쪽으로도 만들 수 있다.
Suphx 자체도 “수비가 강하면 톱이 줄어든다”는 단순한 그림을 깨고 있다. Suphx는 낮은 방총률과 낮은 4위율을 가지면서, 비교표에서 가장 높은 1위율을 냈다.
따라서 정말 너무 지키는지 보려면, 순위율뿐 아니라 어떤 국면에서 밀었고, 어떤 국면에서 내렸는지까지 봐야 한다.
8. 100전 부진은 보통 노이즈다
톱률이 정말 25%라고 가정하고, 각 반장을 독립적인 베르누이 시행으로 보는 매우 거친 근사를 하면, 95% 정도의 오차 폭은 다음과 같다.
| 반장 수 | 톱률 25%의 대략적인 95% 오차 폭 |
|---|---|
| 100 | 약 ±8.5포인트 |
| 500 | 약 ±3.8포인트 |
| 1000 | 약 ±2.7포인트 |
100반장에서 톱률이 20%가 되어도, 그것만으로 “전법이 망가졌다”고는 말할 수 없다.
물론 실제 마작은 독립 동일 분포가 아니다. 상대, 단위, 룰, 본인의 실력 변화가 있다. 위 표는 엄밀한 작혼 모델이 아니라, 단기 성적이 얼마나 흔들리는지 느끼기 위한 자다.
마작은 “100전 했으니 충분하죠”라고 말하는 순간, 분산이 뒤에서 어깨를 톡 친다.
9. AI를 선생님으로 되돌리기: 답이 아니라 이유를 얻는다
AI를 써서 정말 자신을 강하게 만들고 싶다면, AI를 대리 플레이 담당에서 선생님으로 되돌려야 한다.
추천하는 순서는 다음과 같다.
- 먼저 자신의 선택을 정한다. AI를 보기 전에 “나라면 5삭”이라고 기록한다.
- AI의 후보와 비교한다. 맞았는지보다, 차이가 얼마나 나는지 본다.
- 이유를 한 문장으로 묻는다. “중학생도 알 수 있는 말로, 왜?”라고 묻는다.
- 반대 조건을 묻는다. “무엇이 바뀌면, 반대 타패가 정답이 돼?”를 얻는다.
- 실수를 나눈다. 패 효율, 수비, 밀고 빠지기, 타점, 울기, 리치, 순위 조건 등으로 나눈다.
- 같은 실수만 복습한다. 새 지식 10개보다, 3번 나온 같은 구멍을 막는다.
특히 볼 가치가 큰 것은 방총한 국, 리치에 민 국, 울지 말지 망설인 국, AI와 판단이 크게 갈린 국, 남장과 오라스의 순위 조건이다.
작혼에는 패보를 분석해 평가와 조언을 보여주는 MAKA 가 있다. 이런 대국 후 리뷰 기능은 “답을 훔치는” 데보다 “내 습관을 찾는” 데 쓰면 강하다.
10. 확인해야 할 전적 지표
“톱을 못 한다”를 진단할 때, 최소한 보고 싶은 것은 다음이다.
| 지표 | 무엇을 알 수 있나 |
|---|---|
| 1위・2위・3위・4위율 | 순위가 어디에 치우치는지 |
| 화료율 | 손을 완성하는 빈도 |
| 방총률 | 다른 사람에게 쏘는 빈도 |
| 리치율 | 멘젠 텐파이를 얼마나 공격으로 바꾸는지 |
| 부로율 | 울기로 속도와 역 만들기를 어떻게 하는지 |
| 평균 화료점 | 나는 양이 아니라 질 |
| 친・자별 | 친 차례의 가치를 얻고 있는지 |
| 남장・오라스별 | 순위 조건에 대응하는지 |
가능하다면 더 나아가, 순목, 샨텐 수, 대기의 좋고 나쁨, 자신의 타점, 상대 리치, 현재 순위별로 밀고 빠지기를 본다.
여기까지 해야 “요즘 톱이 없어요”가 겨우 분석 가능한 데이터가 된다.
11. 실시간 AI 대리 플레이는 다른 문제다: 패보 검토에 쓴다
학습용 AI와, 대국 중 외부 도구에 판단을 맡기는 것은 다른 문제다.
작혼 공식 공지에서는 부정행위의 구체적인 예로 외부 도구 사용이나 공정성을 해치는 행위를 들고, 계정 정지 대상이 될 수 있다고 한다.
그래서 안전한 기본선은 분명하다.
대국은 스스로 친다. 끝나면 공식 패보와 MAKA 등으로 검토한다.
AI에 전부 맡겨 단위만 오르면, 결국 “역? AI에게 물어보세요. 점수? 서버가 압니다.”라는 수수께끼의 상위 작사가 탄생한다. 연구 이전에 게임에서 내가 맡아야 할 부분이 사라진다.
12. 정리: 2%의 도미노를 쌓아라
마작 AI 연구에서 배울 수 있는 것은 의외로 수수하다.
- 4명이 같은 실력이라면 톱률 기준은 25%다.
- Suphx급이어도 톱률은 약 30%이며, “매번 이기는” 세계가 아니다.
- 강한 AI는 톱 증가와 라스 감소를 동시에 이룰 수 있다.
- “톱이 적고 라스도 적다”만으로는 수비 과다라고 진단할 수 없다.
- 100전 정도라면 순위율은 꽤 흔들린다.
- AI를 답변 기계처럼 너무 많이 쓰면, 자신의 판단 기준이 자라지 않을 수 있다.
- AI에게는 “뭐 버려?”뿐 아니라, “왜?” “무엇이 바뀌면 반대가 돼?”까지 물어야 한다.
상위권은 화려한 필살기보다 몇 %의 차이를 쌓는 게임이다.
오늘도 누군가는 안전패를 1장 남기고, 누군가는 알맞은 울기를 1번 참으며, 누군가는 오라스 조건을 1개 정확히 계산하고 있다.
도미노는 수수하다. 하지만 레이트표만은 마지막에 전부 기억한다.
13. 참고 문헌
- Li, J. et al. (2020). Suphx: Mastering Mahjong with Deep Reinforcement Learning. arXiv:2003.13590. https://arxiv.org/abs/2003.13590
- Microsoft Research. Suphx: The World Best Mahjong AI. https://www.microsoft.com/en-us/research/project/suphx-mastering-mahjong-with-deep-reinforcement-learning/
- Microsoft Research Asia (2019). 微软超级麻将AI Suphx,破解非完美信息游戏. https://www.microsoft.com/en-us/research/articles/mahjong-ai-suphx/
- 雀魂. AIアシスト牌譜分析ツール「MAKA」ベータ版追加. https://mahjongsoul.com/news/254
- 雀魂. 不正行為について. https://mahjongsoul.com/news/24
- Risko, E. F., & Gilbert, S. J. (2016). Cognitive Offloading. Trends in Cognitive Sciences, 20(9), 676–688. https://doi.org/10.1016/j.tics.2016.07.002
- ChatGPT as a cognitive crutch: Evidence from a randomized controlled trial on knowledge retention (2025). Social Sciences & Humanities Open, 12, 102287. https://doi.org/10.1016/j.ssaho.2025.102287
