AI mendapat 99,95% di gim 2D yang cepat dipahami manusia? Makna ARC-AGI-3 tentang menemukan aturan yang belum diketahui dan kemungkinan dipakai untuk mencari edge trading

Kemampuan AI sejak lama tidak merata.

Bagikan artikel ini

Bagikan artikel ini

Iklan
Iklan

0. Kesimpulan lima detik: AI bisa memecahkan soal kelas dunia, tetapi dulu masih bisa tersesat di gim sederhana tanpa manual

Kemampuan AI sejak lama tidak merata.

Mesin sudah melampaui manusia di catur, dan pada 2025 versi lanjutan Gemini Deep Think mendapat 35/42 poin, setara standar medali emas, dalam penilaian resmi Olimpiade Matematika Internasional. Namun model frontier masih bisa kesulitan besar ketika diberi lingkungan 2D sederhana tanpa petunjuk dan tanpa tujuan yang dijelaskan, lalu diminta mencari sendiri apa yang harus dilakukan.[1]

ARC-AGI-3 dirancang untuk mengukur celah itu. Agen harus bertindak, melihat perubahan, menyimpulkan mekanisme, menemukan tujuan, dan membuat rencana tanpa aturan dalam bahasa alami.[2][3]

Pada September 2026, GPT-6 Astra mencapai 62,71% pada ARC-AGI-3 Semi-Private dengan Standard harness dan skor terverifikasi tertinggi 99,95% dengan Provider Adapter OpenAI.[2][4]

Itu bukan bukti bahwa AGI sudah selesai. Skornya bukan 100%, dan hasil 99,95% menggunakan pengelolaan konteks khusus penyedia.

Perubahan yang penting lebih spesifik: AI jauh lebih baik dalam belajar di lingkungan baru ketika pada awalnya bahkan belum jelas apa tugas sebenarnya.

Untuk pasar, peran yang lebih masuk akal bukan “tebak harga besok”, tetapi agen yang menemukan kandidat edge, mengujinya, lalu mencoba menghancurkan kesimpulannya sendiri.

1. Apa itu AGI? Dan 1, 2, 3 adalah generasi tes, bukan level AI

AGI berarti Artificial General Intelligence atau kecerdasan buatan umum.

ARC Prize memandang AGI secara garis besar sebagai sistem yang mampu memperoleh keterampilan yang dapat dipelajari manusia dengan efisiensi yang mirip manusia.[2]

ARC-AGI-1, 2, dan 3 bukan “AGI level 1, 2, dan 3”. Itu adalah generasi benchmark.

  • ARC-AGI-1: diperkenalkan pada 2019; teka-teki grid berwarna yang mengharuskan pemecah menemukan transformasi tersembunyi dari sedikit contoh.[5]
  • ARC-AGI-2: format sama tetapi lebih sulit. Setiap soal yang dimasukkan telah dibuktikan dapat diselesaikan oleh setidaknya dua orang dalam maksimal dua percobaan.[5][6]
  • ARC-AGI-3: berpindah dari puzzle statis ke lingkungan interaktif baru yang harus dipelajari lewat banyak tindakan.[3]

Versi anak-anak:

1 = teka-teki gambar
2 = teka-teki gambar yang jauh lebih kejam 3 = gim baru setelah seseorang membuang manualnya

2. Seperti apa “gim yang belum diketahui”? Dunia 2D yang baru masuk akal setelah disentuh

ARC-AGI-3 memakai lingkungan grid 2D berbasis giliran. Keadaan gim dapat direpresentasikan pada grid sampai 64×64 dan agen memilih dari tindakan yang tersedia.[7]

Intinya, mengetahui tombol yang tersedia tidak memberi tahu apa arti kemenangan.

Contoh buatan, bukan soal resmi, bisa dimulai seperti ini:

■■□□□□
■●□□▲□
□□□■□□

Tidak ada penjelasan.

Bergerak ke kanan membuat titik bergerak. Menyentuh segitiga mengubah warna. Di tempat lain, sesuatu yang mirip pintu terbuka.

Manusia mulai membuat hipotesis:

“Mungkin titik itu adalah saya.”
“Mungkin segitiga itu sakelar.”
“Mungkin saya harus mengubah keadaan sebelum menuju pintu.”

ARC-AGI-3 mengukur siklus eksplorasi → pemodelan → menemukan tujuan → perencanaan dan eksekusi.[2]

Benchmark ini dirancang agar relatif cepat dipahami manusia, tetapi bukan berarti semua anak dapat menamatkan semua gim. Studi manusia 2026 melibatkan 458 peserta; lingkungan dikalibrasi agar dapat diselesaikan manusia, sementara keberhasilan per orang tetap berbeda.[8]

3. Mengapa AI bisa hebat di catur dan matematika sulit tetapi lemah di sini?

Catur memberi aturan lengkap sejak awal. Soal matematika memberi tahu apa yang harus dibuktikan.

Tugasnya bisa sangat sulit, tetapi bingkai masalahnya sudah disediakan.

ARC-AGI-3 menanyakan sesuatu yang lebih awal:

“Apa yang dihitung sebagai kemajuan?”
“Benda ini gunanya apa?”
“Apa yang berubah karena tindakan terakhir saya?”

Manusia melakukan ini terus-menerus dengan perangkat, gim, pekerjaan, dan aplikasi baru. Kita mencoba beberapa kali lalu membuat model kasar: “sepertinya bekerja seperti ini”.

Model frontier sebelumnya memiliki kelemahan besar dalam membangun dan mempertahankan model seperti itu dari sedikit pengalaman.

AI bisa menyelesaikan teorema rumit lalu kebingungan di antarmuka yang terlihat seperti mainan.

4. GPT-5.6 Sol: otaknya kuat, tetapi seperti membuang buku catatan setiap langkah

GPT-5.6 Sol Max mendapat 96,5% di ARC-AGI-1 dan 92,5% di ARC-AGI-2, tetapi hanya 7,78% di ARC-AGI-3 Semi-Private.[9]

OpenAI menyelidiki dan menemukan bahwa sebagian masalah ada pada harness, perangkat lunak yang menghubungkan model dengan gim.[10]

Penalaran tersembunyi dibuang setelah tindakan, dan riwayat lama akhirnya dipotong.

Analogi manusia:

“Kalau menginjak merah, pintu terbuka.”
→ melangkah sekali
→ sobek catatan yang berisi penemuan itu
→ langkah berikutnya: “Benda merah ini apa?”

Ketika OpenAI mengaktifkan penyimpanan penalaran dan pemadatan konteks, skor Sol pada Public set naik dari 13,3% menjadi 38,3%.[10]

Jangan membandingkan 7,78 langsung dengan 38,3: yang pertama Semi-Private, yang lain Public.

Pelajarannya tetap jelas: kemampuan ditentukan bukan hanya oleh penalaran model, tetapi juga oleh cara pengalaman disimpan dan dipadatkan.

5. GPT-6 Astra: 62,71% dan 99,95% bukan jenis hasil yang sama

ARC Prize memverifikasi GPT-6 Astra pada 2 September 2026.[4]

Hasil Semi-Private terbaiknya:

Kondisi Skor terbaik Astra
Standard harness 62,71% (Max)
Provider Adapter 99,95% (High)

Standard harness lebih dekat ke antarmuka minimal yang sama untuk berbagai penyedia, dan model memilih sendiri catatan terlihat yang ingin dipertahankan.

Provider Adapter mempertahankan keadaan penalaran buram khusus penyedia di antara permintaan dan memakai pemadatan untuk konteks panjang.[2][4]

Jadi kalimat “Astra sendirian tanpa bantuan mendapat 99,95%” tidak tepat. Yang lebih tepat: Astra ditambah pengelolaan konteks rancangan OpenAI mendapat 99,95%.

Bahkan 62,71% pada Standard sudah merupakan lonjakan besar dari 7,78% Sol Max pada Semi-Private.[4][9]

Perbandingan dengan manusia juga harus dibaca hati-hati. Astra Max dengan Provider Adapter mendapat 98,55% dan menggunakan lebih sedikit tindakan daripada baseline manusia pada 96,0% level yang diselesaikan, dengan rata-rata 51,7% lebih sedikit tindakan per level.[2]

Itu tidak berarti “lebih pintar daripada 96% manusia”. Itu adalah perbandingan efisiensi per level terhadap median manusia.

6. Apa yang sebenarnya dilakukan Astra? Menulis buku fisika kecil versinya sendiri untuk setiap gim

ARC Prize menyoroti perilaku Astra, bukan hanya skornya.

Alih-alih menyimpan semua observasi mentah, Astra memadatkan informasi tentang:

  • lokasi benda,
  • efek tindakan,
  • keadaan saat ini,
  • rencana yang belum selesai,
  • operasi berikutnya yang berguna.

Astra bahkan membuat notasi simbolik singkat untuk menjelaskan mekanisme gim.[2]

Secara konsep:

merah + tindakan kanan → keadaan B keadaan B + target biru → pintu terbuka

Itulah model dunia kecil: penjelasan internal yang dapat memprediksi apa yang akan dilakukan lingkungan berikutnya.

Jawaban tidak dihafal sebelumnya; struktur yang berguna harus ditarik dari interaksi.

7. Jadi ini AGI? ARC Prize secara eksplisit mengatakan belum

ARC Prize menyebut Astra sebagai perubahan tingkat yang jelas pada kemampuan frontier, tetapi tidak mengklaim bahwa Astra membuktikan AGI.[2]

ARC-AGI-3 masih merupakan dunia terbatas:

  • grid 2D,
  • berbasis giliran,
  • mekanisme deterministik,
  • tujuan tertutup.

Dunia nyata memiliki aturan yang berubah, variabel tersembunyi, lawan strategis, dan tujuan yang ambigu.

Grand Prize juga membutuhkan 100%. Skor 99,95% sangat dekat, tetapi secara resmi bukan 100%.[11]

Kesimpulan yang akurat adalah: kecerdasan umum belum “selesai”, tetapi kelemahan lama dalam belajar efisien di lingkungan interaktif baru berkurang secara drastis.

8. Bisa dipakai untuk apa? Pekerjaan yang aturan lengkapnya tidak bisa ditulis manusia dari awal

Aplikasi yang paling menarik jauh melampaui puzzle.

  1. Simulasi pabrik dan logistik: ubah staf, persediaan, urutan, dan rute untuk mencari kondisi yang menurunkan keterlambatan dan biaya.
  2. Eksplorasi perangkat lunak: belajar antarmuka asing dan menemukan kondisi bug yang dapat direproduksi.
  3. Gim dan robotika: belajar hubungan sebab-akibat tindakan dengan sedikit percobaan.
  4. Iklan, harga, dan operasi: menjelajahi kombinasi keputusan dan mengamati hasil.
  5. Bantuan riset: membuat hipotesis, menguji, membuang yang gagal, memperbarui model sistem.

Instruksinya berubah dari “ikuti aturan ini” menjadi “temukan aturan mana yang benar-benar penting”.

9. Bagaimana dengan saham dan scalping? Penemu kandidat edge lebih masuk akal daripada peramal

Di sini edge berarti keuntungan statistik kecil yang dapat berulang dan tetap ada setelah biaya perdagangan.

Pendekatan ala Astra tidak dimulai dari aturan jadi seperti “beli jika RSI di bawah 30”. Agen mengamati order book, transaksi, harga, spread, volume, dan waktu.

Lalu bertanya:

Kombinasi kondisi saat ini mana yang diikuti sedikit bias arah pada return beberapa detik atau menit berikutnya?

AI bisa mengusulkan hipotesis, misalnya peningkatan mendadak kedalaman bid, lonjakan market buy, spread sempit, dan jendela waktu tertentu.

Itu masih hipotesis, bukan rumus profit.

Pasar berbeda secara fundamental dari ARC karena aturannya tidak tetap. Peserta, berita, likuiditas, regulasi, dan rezim berubah.

Jika hanya diberi perintah “cari pola yang menghasilkan uang”, AI bisa menganggap kebetulan historis sebagai hukum alam.

10. Sistem serius harus memaksa AI menyerang temuannya sendiri

Backtest memakai data historis untuk mengevaluasi aturan trading.

Bahaya muncul ketika ribuan atau jutaan variasi diuji: sebagian akan terlihat luar biasa hanya karena keberuntungan. Inilah masalah backtest overfitting.[12][13]

Edge explorer yang masuk akal harus:

  1. membuat hipotesis;
  2. mencari kandidat pada periode pengembangan;
  3. menolaknya pada data yang tidak pernah dipakai untuk penemuan;
  4. mencoba menghancurkannya di pasar naik, turun, volatil, dan tenang;
  5. memasukkan fee, spread, dan slippage;
  6. mencatat berapa banyak ide yang diuji;
  7. melakukan validasi walk-forward sesuai urutan waktu;
  8. paper trading sebelum uang sungguhan;
  9. menetapkan kondisi berhenti jika edge hilang.

Peran idealnya bukan nabi.

Melainkan satu peneliti yang mengusulkan 1.000 ide dan satu reviewer yang membunuh 998 di antaranya.

11. Kesimpulan: dari “AI yang menjawab” menjadi “AI yang menemukan apa aturannya”

Bagian terpenting ARC-AGI-3 bukan hanya angka 99,95%.

Melainkan siklus:

mengamati → bertindak → gagal → menyimpulkan aturan → memperbaiki hipotesis → bergerak menuju tujuan.

Sol menunjukkan betapa model kuat bisa menderita jika pengalaman tidak disimpan dengan baik. Astra menunjukkan peningkatan besar dalam memadatkan pengalaman menjadi aturan yang berguna lalu mengeksekusinya dengan sedikit interaksi.

Karena itu tugas untuk agen canggih juga bisa berubah.

Bukan hanya:

“Ini aturannya. Jalankan.”

melainkan:

“Ini lingkungan dan datanya. Temukan aturan yang tampaknya penting, coba hancurkan di kondisi lain, dan bawa pulang hanya yang bertahan.”

Tidak ada jaminan hal itu menghasilkan uang di pasar. Pasar jauh lebih kejam daripada ARC.

Tetapi jika AI dipandang bukan sebagai peramal, melainkan mesin untuk menemukan dan menyerang hipotesis, hasil Astra menjadi berita yang sangat praktis.

  1. Google DeepMind — IMO 2025 gold-medal-level result (2025-07-21) deepmind.google
  2. ARC Prize — “OpenAI's GPT-6 Astra on ARC-AGI-3” (2026-09-03) arcprize.org
  3. ARC Prize — “Announcing ARC-AGI-3” (2026-03-25) arcprize.org
  4. ARC Prize Verified Results — GPT-6 Astra (verified 2026-09-02) arcprize.org
  5. ARC Prize — ARC-AGI-1 & ARC-AGI-2 Guide arcprize.org
  6. ARC Prize — “ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems” (2025-05-20) arcprize.org
  7. ARC-AGI-3 Docs — Game Schema docs.arcprize.org
  8. ARC Prize — “Measuring Human Performance on ARC-AGI-3” (2026-04-14) arcprize.org
  9. ARC Prize Verified Results — GPT-5.6 arcprize.org
  10. OpenAI — “How two settings tripled our ARC-AGI-3 scores” (2026-07-29) openai.com
  11. ARC Prize 2026 — ARC-AGI-3 Competition; Grand Prize requires 100% arcprize.org
  12. Bailey, Borwein, López de Prado & Zhu — “The Probability of Backtest Overfitting papers.ssrn.com
  13. Bailey & López de Prado — “How ‘backtest overfitting’ in finance leads to false discoveries” (2021) academic.oup.com

Bagikan artikel ini

Iklan

Cari artikel lain

Semua artikel

Mendoi-chan

Ditulis oleh

Mendoi-chan

Mengubah kerepotan di tempat kerja dan kehidupan sehari-hari menjadi struktur yang jelas dan langkah berikutnya.

Tentang situs
Iklan

Artikel terbaru

  1. 1Saya Tidur 18 Jam dalam Sehari: Tidur Pemulihan atau Tanda yang Perlu Diwaspadai?
  2. 2Haruskah Kita Minta Maaf karena “Belum Memberi Cucu” kepada Orang Tua? Kadang Anak Dewasa Pulang dan Makan Bersama Saja Sudah Berarti
  3. 3Hari ketika VTuber berusia 40 tahun berubah menjadi “balai warga digital”: usia tidak selalu membunuh permintaan—kadang hanya mengubah bentuknya
  4. 4Menyerahkan pekerjaan engineering tingkat senior ke agen AI dari ponsel—dan pindahan rumah selesai lebih dulu
  5. 5Bagaimana otomasi artikel AI berubah menjadi “pabrik otonom” dalam sekitar seminggu: satu pukulan Ultra, Level 6, dan kenapa Level 7 belum perlu buru-buru

Baca juga

Iklan