Bagaimana kemampuan eksplorasi GPT-6 Astra dapat membantu riset scalping? — Ketika AI bisa menggali ribuan kombinasi yang dulu memakan waktu bertahun-tahun, musuh terbesar justru overfitting

Bagikan artikel ini

Bagikan artikel ini

Iklan
Iklan

Orang yang pernah meneliti strategi perdagangan sangat pendek secara manual tahu bahwa bagian paling berat bukan sekadar “menghitung”.

Apa yang dilakukan saat sinyal A muncul? Bagaimana jika B muncul bersamaan? Tetap masuk ketika volatilitas tinggi? Hindari ketika spread melebar? Ikuti tren di sesi ini, tetapi jangan masuk di sesi lain?

Jika setiap cabang diuji satu per satu, malam biasa cepat berubah menjadi laboratorium pribadi. Menghabiskan beberapa jam per hari selama bertahun-tahun lalu hanya menyisakan satu strategi yang tahan uji bukan sesuatu yang aneh.

Lalu datang AI yang kuat dalam eksplorasi.

Dalam alur seperti ini, AI dapat mencoba ribuan variasi dalam skala beberapa jam, membedah mengapa hasil tidak stabil, lalu memakai penyebab kegagalan untuk memilih eksperimen berikutnya.

Reaksi manusia mudah ditebak:

“Kalau semuanya dikerjakan manusia satu per satu, butuh berapa hari?”

Namun kesimpulan “AI bisa menguji 4.000 strategi, berarti selesai” justru berbahaya. Di keuangan, semakin banyak hal dicoba, semakin banyak pula kesempatan menemukan pola yang hanya kebetulan cocok dengan masa lalu.[1][2]

Kombinasi yang lebih berguna adalah:

hipotesis manusia × eksplorasi AI × falsifikasi AI × koreksi statistik untuk pencarian besar-besaran.

Jangan hanya punya AI yang mencari pemenang. Punya juga AI yang tugasnya mencoba menghancurkan pemenang itu.

1. Mengapa riset manual bertahun-tahun bisa terasa tiba-tiba terkompresi

Riset strategi manual adalah rangkaian tugas kecil:

  1. Membuat hipotesis.
  2. Mengimplementasikan kondisi.
  3. Melakukan backtest.
  4. Membaca hasil.
  5. Bertanya mengapa hasil tidak stabil.
  6. Memisahkan kondisi.
  7. Mencoba lagi.

Tidak satu pun langkah harus luar biasa sulit. Bebannya muncul karena diulang ratusan atau ribuan kali.

Manusia juga membayar biaya perpindahan konteks: kemarin sudah menguji apa? Filter ini pernah dipakai? Hasil itu sebelum atau sesudah asumsi spread diubah?

Agen eksplorasi dapat menjaga loop tetap berjalan.

Ia tidak perlu berhenti di “untung”. Ia bisa memeriksa apakah hasil hanya berasal dari beberapa hari, hilang setelah biaya, hanya hidup pada satu sesi, atau runtuh ketika satu komponen dilepas.

Ini lebih dari backtest yang lebih cepat.

Ini adalah iterasi riset yang lebih cepat.

2. Kekuatan Astra lebih mirip “bisa bergerak di lingkungan asing” daripada “sudah tahu jawabannya”

ARC-AGI-3 membantu menjelaskan kemampuan ini.

Ini adalah benchmark interaktif berisi lingkungan grid 2D baru tanpa instruksi bahasa alami dan tanpa tujuan yang dinyatakan. Agen harus mengeksplorasi, menyimpulkan aturan, membangun model lingkungan, menemukan tujuan, merencanakan tindakan, lalu memperbaiki rencana ketika gagal.[3][4]

Pada Juli 2026, GPT-5.6 Sol mencetak 7,78% pada set semi-private ARC Prize. OpenAI juga menunjukkan pada set publik bahwa mempertahankan state penalaran dan melakukan kompaksi konteks dapat menaikkan Sol dari 13,3% menjadi 38,3% dalam konfigurasi yang berbeda.[5]

Pada September, Astra mencetak 62,7% pada set semi-private yang sama dengan Standard harness ARC Prize dan 99,9% dengan Provider Adapter yang mempertahankan lebih banyak state penalaran antartindakan. Karena desain harness sangat memengaruhi skor, angka 99,9 dan 7,78 tidak boleh dibaca sebagai perbandingan rasio sederhana pada kondisi identik. Hal pentingnya adalah lompatan dalam eksplorasi, pemodelan state, dan adaptasi jangka panjang.[6][3]

ARC Prize juga melaporkan bahwa pada 96% level yang diselesaikan Astra, jumlah tindakannya lebih sedikit daripada median manusia yang berhasil menyelesaikan level tersebut.[3]

Ini berbeda dari sekadar memecahkan satu persamaan sulit.

Lebih mirip:

“Kalau saya sentuh ini, apa yang terjadi? Baik. Kalau yang itu? Oh, sekarang saya mengerti aturannya.”

Menariknya, lingkungan 2D yang tampak cukup sederhana bagi anak-anak justru lama sulit bagi AI. Itu membuat perubahan dalam kemampuan eksplorasi interaktif terlihat jelas.

ARC Prize juga tidak mengklaim bahwa memenuhi ARC-AGI-3 membuktikan AGI. Benchmark ini tertutup dan deterministik, berbeda dari dunia nyata.[3]

3. Mengapa eksplorasi game 2D terasa mirip dengan riset scalping

Pasar bukan puzzle deterministik. Ada pelaku lain, informasi tersembunyi, perubahan regime, biaya, dan kendala eksekusi.

Namun loop risetnya bisa mirip.

Misalnya, menambahkan kondisi ketidakseimbangan order book membuat backtest membaik.

Pertanyaan berikutnya wajib muncul:

  • Apakah ketidakseimbangan itu sendiri benar-benar prediktif?
  • Hanya bekerja saat volatilitas tinggi?
  • Hanya terlihat bagus karena spread rendah?
  • Hilang jika eksekusi memburuk satu tick?
  • Hanya ada di satu sesi?

Amati. Ubah kondisi. Ukur. Perbarui hipotesis.

Strukturnya mirip siklus ARC-AGI-3: persepsi, tindakan, umpan balik, pembaruan model, lalu tindakan berikutnya.[3][4]

Karena itu, instruksi yang lebih baik daripada “cari parameter paling menguntungkan” adalah:

“Uraikan mengapa keuntungan ini muncul, cari kondisi yang membunuhnya, lalu jadikan penyebab kematian itu eksperimen berikutnya.”

4. Pengalaman manusia tidak hilang — “bagian ini terasa menjanjikan” menjadi peta awal

AI tentu bisa disuruh mulai dari nol.

Namun semakin besar ruang pencarian, semakin berguna pengalaman manusia untuk menentukan di mana anggaran eksplorasi pertama dipakai.

Orang yang bertahun-tahun membaca dan menguji komponen biasanya punya pengetahuan terkompresi seperti:

  • lemah jika berdiri sendiri, mungkin berguna sebagai filter;
  • menarik hanya saat pasar sedang trending;
  • bagus di backtest, rapuh setelah biaya;
  • lebih baik untuk mencegah entry buruk daripada menebak arah;
  • tampak kuat, tetapi mungkin terkonsentrasi pada satu periode.

Ini bukan daftar kebenaran.

Ini adalah petunjuk awal atas ruang pencarian.

Pola serupa muncul di sains. Co-Scientist 2026 memulai dari tujuan yang ditetapkan peneliti dan bukti sebelumnya, lalu berulang kali menghasilkan, mengkritik, memberi peringkat, dan mengembangkan hipotesis dengan menambah komputasi saat pengujian.[7]

Dalam trading, manusia dapat berkata “mulai gali di sini”, lalu AI mengeksplorasi ribuan cabang di sekitarnya.

Pengalaman paling berguna sebagai pengarah anggaran, bukan dogma.

5. Mengapa kombinasi menjadi neraka jika dilakukan manual

Bayangkan 20 komponen.

Dengan hanya dua pilihan — dipakai atau tidak — sudah ada:

2^20 = 1.048.576 kombinasi.

Dengan tiga pilihan — tidak dipakai, dipakai normal, dipakai terbalik — menjadi:

3^20 = 3.486.784.401 kombinasi.

Peneliti nyata tidak menguji semuanya secara brute force. Pengetahuan domain membuang kombinasi yang tidak masuk akal sejak awal.

Namun riset nyata juga menambahkan ambang, waktu, volatilitas, spread, lama posisi, pengecualian berita, perbedaan long/short, dan asumsi fill.

Jadi proses lama berupa:

“Bagaimana kalau ditambah ini? Kalau kasus itu dikeluarkan? Kalau hanya regime ini?”

sebenarnya adalah manusia berjalan di pohon pencarian bersyarat yang sangat besar.

Wajar jika memakan waktu bertahun-tahun.

Spreadsheet tidak bersalah. Alam semestanya terlalu luas.

6. Nilai AI bukan brute force, tetapi memilih eksperimen berikutnya

Agen eksplorasi yang baik mengubah tes berikutnya berdasarkan hasil sebelumnya.

Jika strategi terdiri dari A+B+C+D, lepas satu komponen setiap kali.

  • D dilepas hampir tidak berubah → D mungkin hanya dekorasi.
  • B lemah sendiri, tetapi A+B menurunkan drawdown → B mungkin filter, bukan sinyal prediksi.
  • C lemah secara keseluruhan, tetapi kuat saat volatilitas tinggi → C mungkin tergantung regime.

Menghapus komponen untuk memahami kontribusinya sering disebut ablation test.

Nama tidak sepenting tujuannya:

membongkar strategi kompleks dan mempertahankan bagian yang benar-benar bekerja.

Eksplorasi → gagal → klasifikasikan penyebab → pilih eksperimen berikutnya.

Jika loop ini otomatis, model mulai berfungsi sebagai asisten riset, bukan hanya optimizer.

7. Bahaya terbesar tetap overfitting — uji 4.000 hal dan pasti muncul “jenius yang beruntung”

Ini masalah kritis dalam keuangan.

Jika 4.000 strategi diuji lalu hanya yang paling cantik ditampilkan, pemenangnya mungkin sekadar kecocokan paling beruntung dengan sejarah.

White memformalkan masalah data snooping: memakai data yang sama berulang kali untuk inferensi dan pemilihan model memungkinkan hasil bagus muncul karena kebetulan, bukan karena metode benar-benar unggul.[1]

Menggabungkan banyak sinyal memperburuk masalah.

Novy-Marx menunjukkan bahwa strategi multi-sinyal dapat mengalami bias overfitting yang berat, dan kombinasi sinyal acak tanpa daya prediksi nyata pun dapat menghasilkan backtest yang tampak sangat signifikan setelah seleksi.[2]

Kemampuan eksplorasi punya dua sisi.

AI bisa salah ribuan kali lebih cepat.

Lalu memberi piala kepada kesalahan yang paling indah.

Semakin besar pencarian, semakin pertahanan terhadap overfitting harus menjadi bagian dari mesin pencarian itu sendiri.

8. Pertahanan dimulai dengan mencatat semua percobaan dan menyegel data final dari proses seleksi

Jika ribuan kandidat dieksplorasi, kandidat yang gagal juga bagian dari bukti.

Alur yang kuat setidaknya mencakup:

  1. Catat semua trial. Apa yang berubah, berapa banyak variasi, dan alasan penolakan.
  2. Pisahkan data penemuan dan evaluasi final. Jangan terus mengintip set final saat memilih model.
  3. Validasi maju berdasarkan waktu. Bangun dari data lebih awal dan tes di data berikutnya dengan walk-forward.
  4. Buat eksekusi sengaja lebih buruk. Naikkan spread, biaya, slippage, latensi, dan asumsi fill pesimistis.
  5. Goyang parameter. Strategi yang hanya hidup di satu angka ajaib patut dicurigai.
  6. Pisahkan regime. Lihat apakah profit hanya berasal dari satu tahun, sesi, kondisi volatilitas, arah, atau sedikit transaksi.
  7. Koreksi fakta bahwa sangat banyak percobaan telah dilakukan.

Deflated Sharpe Ratio, DSR, menyesuaikan interpretasi Sharpe terhadap bias seleksi akibat multiple testing dan return yang tidak normal.[8]

Probability of Backtest Overfitting, PBO, dirancang untuk backtest investasi dan memperkirakan peluang overfitting dengan combinatorially symmetric cross-validation.[9]

Reality Check White menangani data snooping pada banyak kandidat, sedangkan uji SPA Hansen dibuat lebih kuat dan lebih sedikit dipengaruhi alternatif buruk atau tidak relevan.[1][10]

Tidak perlu menghafal semua singkatan.

Aturannya:

jika pemenang muncul setelah 4.000 percobaan, nilai dia sebagai pemenang turnamen 4.000 percobaan.

Dan setelah data final dilihat lalu strategi diubah, data itu tidak lagi benar-benar final dan tak tersentuh.

9. Arsitektur kuat dapat memakai dua AI: satu mencari pemenang, satu mencoba membunuhnya

Bagi peran secara jelas.

AI eksplorasi

  • membuat kondisi baru;
  • menggabungkan ulang hipotesis manusia;
  • mencari efek per regime;
  • mengubah penyebab gagal menjadi eksperimen baru.

AI falsifikasi

  • memperburuk biaya;
  • menunda eksekusi;
  • menghapus hari tertentu;
  • menggeser ambang;
  • pindah periode dan pasar;
  • menerapkan DSR, PBO, Reality Check, dan SPA;
  • mengecek apakah profit hanya berasal dari sedikit observasi.

AI pertama berkata, “Ketemu.”

AI kedua bertanya, “Benarkah?”

Jika selamat, pukul lagi.

Dalam riset keuangan, sifat menyebalkan itu adalah quality control.

Tujuan sebaiknya bukan “profit historis maksimum”, tetapi:

“struktur yang tetap dapat dijelaskan dan bertahan setelah asumsi, parameter, biaya, dan sampel dirusak secara wajar.”

10. Saat model baru keluar, cari kemampuan yang baru saja menembus tembok — bukan hanya skor total

Pelajaran ini jauh lebih luas daripada scalping.

Saat AI baru dirilis, kenaikan kecil di benchmark umum bisa kalah penting dibanding satu tugas aneh yang berubah dari nyaris mustahil menjadi praktis.

Pertanyaan yang berguna:

“Pekerjaan apa yang tidak ekonomis pada generasi sebelumnya, tetapi sekarang tiba-tiba layak?”

Pada Astra, ARC-AGI-3 menonjolkan eksplorasi lingkungan asing, pembangunan model dunia ringkas, pemeliharaan state, dan tindakan yang efisien.[3]

Lalu hubungkan kemampuan itu dengan hambatan nyata:

  • Di mana manusia banyak kehilangan waktu hanya untuk memilih eksperimen berikutnya?
  • Di mana ada ribuan hipotesis yang bisa diuji?
  • Apakah sukses dan gagal dapat diukur objektif?
  • Apakah pengulangan membuat selisih biaya tenaga kerja sangat besar?
  • Apakah eksplorasi yang lebih baik berubah menjadi profit, penghematan, atau R&D yang lebih cepat?

Semakin banyak jawaban “ya”, semakin menarik peluangnya.

Sains sudah bergerak ke arah serupa: Co-Scientist memperbesar loop menghasilkan, mengkritik, membandingkan, dan mengembangkan hipotesis.[7]

Jadi peluncuran model bisa dipandang sebagai perburuan harta:

“Bagian kerja manusia yang sangat melelahkan mana yang baru saja menjadi bisa dijalankan pada skala mesin?”

Ringkasnya:

Manusia menggambar peta pertama. AI menggali melewati peta. Statistik bertanya apakah benda berkilau itu benar-benar emas.

Semakin kuat AI, semakin perlu ada pihak yang skeptis.

Pihak skeptis itu juga bisa AI lain.


  1. Halbert White — A Reality Check for Data Snooping, Econometrica 68(5), 2000 onlinelibrary.wiley.com
  2. Robert Novy-Marx — Backtesting Strategies Based on Multiple Signals, NBER Working Paper 21329, 2015 nber.org
  3. ARC Prize — OpenAI's GPT-6 Astra on ARC-AGI-3 (2026-09-03) arcprize.org
  4. ARC Prize — Announcing ARC-AGI-3 / ARC-AGI-3 documentation https://docs.arcprize.org/ arcprize.org
  5. OpenAI — How two settings tripled our ARC-AGI-3 scores (GPT-5.6 Sol) openai.com
  6. OpenAI — GPT-6 Astra: A new generation of intelligence openai.com
  7. Juraj Gottweis et al. — Accelerating scientific discovery with Co-Scientist, Nature, 2026 nature.com
  8. David H. Bailey & Marcos López de Prado — The Deflated Sharpe Ratio: Correcting for Selection Bias, Backtest Overfitting, and Non-Normality, 2014 doi.org
  9. David H. Bailey, Jonathan Borwein, Marcos López de Prado & Qiji Jim Zhu — The Probability of Backtest Overfitting, 2015 papers.ssrn.com
  10. Peter Reinhard Hansen — A Test for Superior Predictive Ability, Journal of Business & Economic Statistics 23(4), 2005 tandfonline.com

Bagikan artikel ini

Iklan

Cari artikel lain

Semua artikel

Mendoi-chan

Ditulis oleh

Mendoi-chan

Mengubah kerepotan di tempat kerja dan kehidupan sehari-hari menjadi struktur yang jelas dan langkah berikutnya.

Tentang situs
Iklan

Artikel terbaru

  1. 1Saya Tidur 18 Jam dalam Sehari: Tidur Pemulihan atau Tanda yang Perlu Diwaspadai?
  2. 2Haruskah Kita Minta Maaf karena “Belum Memberi Cucu” kepada Orang Tua? Kadang Anak Dewasa Pulang dan Makan Bersama Saja Sudah Berarti
  3. 3Hari ketika VTuber berusia 40 tahun berubah menjadi “balai warga digital”: usia tidak selalu membunuh permintaan—kadang hanya mengubah bentuknya
  4. 4Menyerahkan pekerjaan engineering tingkat senior ke agen AI dari ponsel—dan pindahan rumah selesai lebih dulu
  5. 5Bagaimana otomasi artikel AI berubah menjadi “pabrik otonom” dalam sekitar seminggu: satu pukulan Ultra, Level 6, dan kenapa Level 7 belum perlu buru-buru

Baca juga

Iklan