1. Kesimpulan: AI mahjong bukan sihir untuk melonjakkan tingkat kemenangan; ia mesin untuk menumpuk keunggulan beberapa persen
Dalam mahjong empat pemain, bila kekuatan keempat pemain sama, titik awal peluang menjadi peringkat pertama adalah 25%. Itulah fakta kejam pertama.
Pemain elite maupun AI kuat tidak tiba-tiba memenangkan separuh pertandingan. Pada level tinggi, keunggulan muncul sebagai perbedaan kecil yang konsisten: beberapa poin persentase lebih banyak peringkat pertama, beberapa poin lebih sedikit peringkat terakhir, sedikit lebih jarang membuang keping yang memberi lawan kemenangan (deal-in), serta keputusan yang berubah mengikuti skor, ronde, posisi dealer, nilai tangan, dan risiko.
Mahjong tingkat atas bukan lomba jurus pamungkas. Ini lebih mirip bekerja di pabrik domino: simpan satu keping aman, dorong tangan yang sudah siap menang (tenpai) bila nilainya dan bentuk tunggunya bagus, tinggalkan pertarungan murah yang buruk, lalu mainkan tangan terakhir sesuai syarat peringkat. Satu keputusan tampak kecil. Setelah ratusan pertandingan penuh (hanchan), rating mengingat semuanya.
Catatan ilmiahnya: belum ada estimasi kausal yang kuat seperti “belajar memakai AI pasti menaikkan tingkat peringkat pertama manusia sebesar X poin persentase”. Kekuatan kebijakan AI dan efek belajar manusia dari AI adalah dua pertanyaan berbeda.
2. Titik awal 25% yang kejam dalam mahjong empat pemain
Dengan empat pemain yang simetris, rata-rata setiap peringkat adalah 25%. Jadi anggapan “kalau benar-benar jago harus menang setengah pertandingan” keliru.
Mahjong punya banyak informasi tersembunyi, pengambilan keping acak, dan tiga lawan. Keputusan bagus bisa kalah; keputusan buruk bisa menang satu tangan. Karena itu kemampuan lebih terlihat pada distribusi peringkat jangka panjang dan kualitas keputusan daripada hasil satu sesi.
“Hari ini tidak juara, berarti strategi rusak” seperti menilai iklim bumi dari cuaca satu sore.
3. Suphx: tingkat peringkat pertama sekitar 30% saja sudah luar biasa kuat
Suphx dari Microsoft Research adalah salah satu sistem penting dalam riset mahjong berbasis deep reinforcement learning. Dalam evaluasi yang dipublikasikan, Suphx memainkan 5.760 hanchan di expert room Tenhou dan mencapai stable rank 8,74, dibanding 7,46 untuk kelompok manusia tingkat atas yang menjadi pembanding.
Tabel 5 dalam paper melaporkan:
| Metrik | Suphx | Manusia top | Bakuuchi | NAGA |
|---|---|---|---|---|
| Peringkat 1 | 29,3% | 28,0% | 28,0% | 25,6% |
| Peringkat 4 | 18,7% | 20,5% | 22,4% | 21,1% |
| Tingkat menang per tangan | 22,83% | - | 23,07% | 22,69% |
| Tingkat deal-in | 10,06% | - | 12,16% | 11,42% |
Yang menarik bukan cuma 29,3%. Suphx sekaligus memiliki tingkat peringkat pertama tertinggi, tingkat peringkat keempat terendah, dan tingkat deal-in terendah pada tabel tersebut.
Ini merusak cerita sederhana “lebih banyak juara harus dibayar dengan lebih banyak posisi terakhir”. Kebijakan yang lebih baik dapat memperbaiki kedua ujung distribusi sekaligus.
Suphx juga memakai gagasan untuk memperkirakan hasil akhir seluruh pertandingan, yang dalam paper disebut Global Reward Prediction. Tujuannya menghubungkan keputusan per ronde dengan imbalan akhir permainan. Langkah terbaik untuk satu tangan belum tentu terbaik untuk seluruh hanchan.
Namun ini adalah data Tenhou, bukan Mahjong Soul. Sistem rank dan populasi pemain berbeda, jadi angka 29,3% tidak boleh disalin menjadi target universal.
4. Rank tinggi adalah pabrik pengrajin domino
Di level pemula, belajar efisiensi keping saja bisa memberi keuntungan besar. Di rank atas, hampir semua orang sudah mengambil “uang gratis” itu.
Yang tersisa adalah keputusan kecil: kapan menyimpan keping aman, memilih bentuk tunggu yang lebih baik atau nilai lebih tinggi, seberapa jauh mendorong melawan riichi, apakah kondisi satu langkah dari tenpai (iishanten) layak diperjuangkan, bagaimana status dealer mengubah risiko, serta kapan posisi kedua di ronde South harus mengejar posisi pertama atau menjaga peringkat.
Satu keputusan kecil. Lima ratus pengulangan tidak kecil.
Rank tinggi adalah pabrik tempat orang yang menertawakan selisih 0,5% perlahan dikubur oleh expected value dengan sangat sopan.
5. Terlalu banyak menyerahkan keputusan bisa membuat “operator AI yang tidak tahu aturan”
“Buang yang mana?” → AI. “Perlu call?” → AI. “Tunggu keping apa?” → AI. “Ini yaku apa?” → Katanya AI bisa menang.
Performa bisa naik lebih dulu daripada pemahaman. Yang dipelajari mungkin cara mengoperasikan analyzer mahjong, bukan mahjong itu sendiri.
Dalam psikologi, memindahkan sebagian pekerjaan berpikir ke alat eksternal agar beban mental berkurang disebut cognitive offloading. Tinjauan Risko dan Gilbert menjelaskan bahwa externalization memang dapat menurunkan beban kognitif, tetapi cara kita mengalihkannya juga punya konsekuensi kognitif.
Sebuah uji acak pada 2025 terhadap 120 mahasiswa menemukan retensi pengetahuan setelah 45 hari lebih rendah pada kelompok yang menggunakan ChatGPT tanpa batas sebagai alat belajar dibanding kelompok belajar tradisional. Itu bukan penelitian mahjong, jadi bukan bukti langsung. Namun pesannya relevan: mengalihdayakan jawaban tidak menjamin kita membangun proses mental yang menghasilkan jawaban tersebut.
Seperti mengikuti walkthrough sampai final boss, lalu diberi tahu ujian sebenarnya tentang tutorial.
6. Apa arti “sulit juara, tetapi juga jarang terakhir”?
Gejala ini saja belum cukup. Setidaknya empat hipotesis cocok:
- Terlalu defensif: risiko yang sebenarnya menguntungkan ikut ditolak sehingga hasil menumpuk di posisi dua atau tiga.
- Masalah kualitas serangan: riichi, call, kecepatan, atau nilai tangan tidak mengubah peluang menjadi posisi pertama.
- Masalah kondisi peringkat: di ronde South atau tangan terakhir, kesempatan mengejar posisi satu tidak diambil dengan benar.
- Varians: strategi tidak berubah; sampel terbaru kebetulan berisi lebih sedikit posisi pertama.
Karena itu “tingkat peringkat keempat rendah berarti terlalu defensif” bukan diagnosis berbasis riset.
7. Secara ilmiah, persentase peringkat saja tidak cukup untuk mengidentifikasi pertahanan berlebihan
Statistik agregat punya masalah identifikasi: mekanisme berbeda dapat menghasilkan keluaran yang sama.
Catatan 20% posisi pertama dan 15% posisi terakhir bisa berasal dari terlalu sering fold, nasib buruk pada tangan bernilai tinggi, pengelolaan akhir yang buruk, atau sekadar noise dari sekitar seratus pertandingan.
Suphx sendiri mematahkan cerita “pertahanan bagus berarti peringkat pertama berkurang”. Ia bertahan sangat baik sekaligus memiliki tingkat peringkat pertama tertinggi dalam tabel pembanding.
Untuk mendiagnosis pertahanan berlebihan, kita perlu konteks: giliran, shanten, kualitas bentuk tunggu, nilai tangan, status dealer, posisi saat itu, riichi lawan, dan keputusan konkret untuk mendorong atau mundur (push/fold).
8. Periode buruk 100 pertandingan bisa saja hanya noise
Misalkan peluang peringkat pertama yang sebenarnya 25%, lalu secara sangat kasar setiap hanchan dianggap sebagai percobaan Bernoulli independen. Margin sampling sekitar 95% adalah:
| Hanchan | Margin kasar di sekitar 25% |
|---|---|
| 100 | ±8,5 poin persentase |
| 500 | ±3,8 poin |
| 1.000 | ±2,7 poin |
Jadi tingkat peringkat pertama 20% dalam 100 hanchan belum membuktikan strategi rusak.
Mahjong Soul nyata bukan rangkaian percobaan identik yang sepenuhnya independen: lawan, rank, aturan, dan kekuatan pemain berubah. Tabel ini hanya penggaris kasar untuk merasakan seberapa besar sampel pendek dapat bergoyang.
Varians mahjong sangat sopan: ia menunggu Anda berkata “100 game pasti cukup”, lalu menepuk bahu dari belakang.
9. Jadikan AI guru lagi: ambil alasan, bukan hanya jawaban
Siklus review yang lebih baik:
- Tentukan pilihan sendiri sebelum membuka AI.
- Bandingkan dengan kandidat AI.
- Minta alasan dalam satu kalimat sederhana.
- Tanyakan kondisi pembalik: “apa yang harus berubah agar keputusan sebaliknya menjadi benar?”
- Tandai kesalahan: efisiensi, pertahanan, push/fold, nilai tangan, call, riichi, atau pengelolaan peringkat.
- Review kesalahan yang berulang, bukan mengoleksi tips baru tanpa akhir.
Tangan yang paling berguna biasanya adalah deal-in, keputusan push/fold yang tipis, call/no-call, perbedaan besar dengan AI, serta situasi ronde South dan tangan terakhir.
MAKA di Mahjong Soul dapat menganalisis log ranked empat pemain dan menampilkan evaluasi serta saran. Setelah pertandingan, alat ini lebih berguna sebagai detektor pola kesalahan berulang daripada kunci jawaban.
10. Statistik yang layak diperiksa
| Metrik | Apa yang dapat terlihat |
|---|---|
| Peringkat 1/2/3/4 | Di mana hasil menumpuk |
| Tingkat menang per tangan | Seberapa sering tangan dikonversi menjadi kemenangan |
| Tingkat deal-in | Risiko pertahanan dan kerugian |
| Tingkat riichi | Pemanfaatan tenpai tertutup sebagai tekanan atau nilai |
| Tingkat call | Kecenderungan mengejar kecepatan dengan tangan terbuka |
| Nilai rata-rata kemenangan | Kualitas, bukan hanya jumlah kemenangan |
| Dealer/non-dealer | Apakah nilai giliran dealer dimanfaatkan |
| South/tangan terakhir | Kualitas pengelolaan peringkat |
Lebih baik lagi bila keputusan push/fold dianalisis berdasarkan giliran, shanten, bentuk tunggu, nilai tangan, riichi lawan, status dealer, dan skor saat itu.
Baru saat itu “akhir-akhir ini tidak juara” menjadi masalah data yang dapat dianalisis.
11. Bantuan AI real-time adalah masalah berbeda: gunakan untuk review setelah game
Belajar dengan AI tidak sama dengan membiarkan alat eksternal memilih langkah selama pertandingan ranked.
Pemberitahuan resmi Mahjong Soul mencantumkan penggunaan alat eksternal dan tindakan lain yang merusak fairness sebagai contoh perilaku terlarang, dengan kemungkinan sanksi akun.
Garis amannya sederhana: mainkan pertandingan sendiri; setelah selesai, analisis log dengan sistem review yang diizinkan seperti MAKA.
Kalau tidak, build langka akan terbuka: rank tinggi, memori aturan nol. Yaku? Tanya AI. Skor? Server pasti tahu.
12. Ringkasan: tumpuk domino 2%
- Empat pemain setara memulai dari baseline 25% untuk peringkat pertama.
- Bahkan Suphx berada sekitar 30%, bukan 50%.
- Kebijakan kuat dapat menambah peringkat pertama sekaligus mengurangi peringkat terakhir.
- “Peringkat pertama sedikit + peringkat terakhir sedikit” tidak membuktikan pertahanan berlebihan.
- Sampel pendek sangat berisik.
- Terlalu banyak cognitive offloading ke AI dapat memisahkan performa dari pemahaman.
- Jangan hanya tanya “apa?”, tetapi juga “mengapa?” dan “kondisi apa yang membalik jawabannya?”.
Mahjong level tinggi adalah permainan menumpuk keuntungan kecil.
Domino itu membosankan. Tabel rating mengingat semuanya.
13. Referensi
- Li, J. et al. (2020). Suphx: Mastering Mahjong with Deep Reinforcement Learning. https://arxiv.org/abs/2003.13590
- Microsoft Research. Suphx: The World Best Mahjong AI. https://www.microsoft.com/en-us/research/project/suphx-mastering-mahjong-with-deep-reinforcement-learning/
- Mahjong Soul. MAKA AI-assisted game-log analysis. https://mahjongsoul.com/news/254
- Mahjong Soul. Notice on unfair conduct. https://mahjongsoul.com/news/24
- Risko, E. F., & Gilbert, S. J. (2016). Cognitive Offloading. https://doi.org/10.1016/j.tics.2016.07.002
- ChatGPT as a cognitive crutch (2025). https://doi.org/10.1016/j.ssaho.2025.102287
