Ketika pemilih model menampilkan Low, kesan pertama biasanya “mode hemat”, “untuk tugas ringan”, atau “belum berpikir serius”.
GPT-6 Astra membuat intuisi itu goyah.
Dalam evaluasi pihak ketiga Artificial Analysis yang sama, Astra Low mengungguli GPT-5.6 Sol xhigh pada Intelligence Index gabungan, unggul lebih besar pada sebagian benchmark coding berbasis agen, dan pada beban evaluasi itu bahkan mencatat biaya per tugas yang lebih rendah.[1]
Maka pertanyaannya jelas:
“Kalau begitu, kenapa tidak pakai Astra Low terus saja?”
Jawaban praktisnya: Low sangat kuat sebagai default, tetapi jangan dijadikan aturan permanen.
Mulai dari Low. Naik ke Medium ketika ada kegagalan nyata atau masalah memang lebih rumit. Simpan High dan xhigh untuk sedikit pekerjaan yang benar-benar memerlukannya.
Namanya Low. Tingkahnya tidak rendah hati.
1. Angka dulu — Sol xhigh vs Astra Low, Medium, High, dan xhigh
Data Artificial Analysis yang dicek pada 12 September 2026.[1][2][3][4]
| Pengaturan | Intelligence Index | AutomationBench-AA | Terminal-Bench v4.0 | SciCode | Biaya AA/tugas | Token output/tugas | Token reasoning/tugas |
|---|---|---|---|---|---|---|---|
| GPT-5.6 Sol xhigh | 44 | 55% | 25% | 57% | $1.18 | ~20k | ~10k |
| GPT-6 Astra Low | 46 | 59% | 42% | 54% | $0.82 | ~4k | ~938 |
| GPT-6 Astra Medium | 50 | 65% | 49% | 54% | $1.54 | ~10k | ~3k |
| GPT-6 Astra High | 51 | 67% | 54% | 55% | $1.72 | ~12k | ~5k |
| GPT-6 Astra xhigh | 53 | 67% | 60% | 56% | $2.31 | ~17k | ~9k |
Skor 46 vs 44 tidak boleh diterjemahkan menjadi “4,5% lebih pintar”. Intelligence Index adalah indeks gabungan, bukan skala rasio seperti harga.
Yang bisa dikatakan: Astra Low mendapat 46 sementara Sol xhigh 44, dan Terminal-Bench v4.0 menunjukkan 42% vs 25%.[1]
Namun SciCode dimenangkan Sol xhigh 57% vs Astra Low 54%. Low bukan pemenang mutlak di semua dimensi.[1]
2. Paradoks harga — tarif token 2,5×, tetapi Low lebih murah per tugas benchmark
Harga API resmi OpenAI: Astra $10/$1/$50 per 1 juta token input/cached-input/output; Sol $4/$0,40/$20.[5][6]
Dengan jumlah token yang sama, Astra 2,5 kali lebih mahal.
Rate credit Work/Codex juga memiliki rasio yang sama: Astra 250/25/1.250 dan Sol 100/10/500 credit per 1M.[7]
Tetapi Artificial Analysis mengukur $0,82 per tugas untuk Astra Low dan $1,18 untuk Sol xhigh.[1]
Ini bisa terjadi karena harga per token yang lebih tinggi tetap dapat menghasilkan biaya tugas lebih rendah jika token yang dipakai jauh lebih sedikit.
Pada evaluasi itu, Sol xhigh memakai sekitar 20k output dan 10k reasoning token per tugas; Astra Low sekitar 4k dan 938.[1]
Seperti taksi mahal yang langsung ke tujuan melawan taksi murah yang berkeliling kompleks tiga kali.
Angka $0,82 dan $1,18 adalah rata-rata tertimbang tugas Artificial Analysis, bukan tagihan Codex yang dijamin untuk semua proyek.[1]
3. OpenAI sendiri menyarankan mulai dari Low atau Medium
Panduan Astra untuk Work/Codex memisahkan pemilihan model dari reasoning effort.[8]
Effort rendah cocok sebagai titik awal untuk respons lebih cepat atau menghemat allowance; Medium menyeimbangkan waktu dan kedalaman; effort lebih tinggi untuk masalah yang benar-benar sulit.[8]
OpenAI juga menyatakan Astra Low dapat mengungguli Sol High dan menyarankan mencoba Astra Low atau Medium bila Sol High sudah memberi hasil baik.[8]
Yang lebih penting: effort lebih tinggi tidak selalu menghasilkan jawaban lebih baik.[8]
Ini bukan toko RPG tempat pedang termahal selalu menang.
4. Pekerjaan apa yang cocok tetap di Low?
Low cocok menjadi default ketika tujuan, file, dan kriteria selesai sudah jelas.
Implementasi terbatas, perubahan kode lokal, refactor, penambahan tes, review rutin, investigasi error yang diketahui, rangkuman, perbandingan, dan tugas berulang dengan aturan eksplisit adalah kandidat bagus.
OpenAI juga menyarankan memeriksa instruksi, file, aplikasi terhubung, dan izin sebelum menaikkan effort. Reasoning tidak dapat menciptakan informasi atau akses yang tidak tersedia.[8]
Tidak punya izin file plus xhigh tetap berarti tidak punya izin file.
5. Kapan naik dari Low ke Medium?
Jika Low melewatkan satu persyaratan yang jelas walau materi dan akses sudah lengkap, tidak perlu langsung lompat ke xhigh. Medium adalah eskalasi pertama yang masuk akal.
Dependensi lintas file, requirement ambigu, bug dengan beberapa penyebab mungkin, trade-off arsitektur, rencana implementasi panjang, dan perbaikan sambil membaca tes gagal cocok untuk Medium.
Astra Medium mencetak Index 50, Terminal-Bench 49%, dan $1,54 per tugas evaluasi.[2]
Lebih dalam dari Low, tetapi belum artileri berat.
6. Kapan High dan xhigh layak dipakai?
High masuk akal ketika Medium masih gagal menangkap masalah inti, atau ketika concurrency, performa, keamanan, dan migrasi data membuat keputusan salah sangat mahal.
Astra High: Index 51, Terminal-Bench 54%, $1,72 per tugas.[3]
xhigh cocok untuk analisis root cause tersulit, pekerjaan otonom panjang, redesign dengan banyak constraint, dan tugas sekali jalan dengan biaya kegagalan tinggi. Index 53 dan Terminal-Bench 60% adalah tertinggi dalam perbandingan ini, dengan biaya $2,31 per tugas.[4]
Pergi ke minimarket dengan helikopter memang bisa. Bahan bakar tetap perlu dibayar.
7. Apakah Sol xhigh sudah tidak berguna? Belum
SciCode memberi Sol xhigh 57%, lebih tinggi dari Astra Low/Medium/High/xhigh 54/54/55/56%.[1][2][3][4]
Dengan jumlah token sama, harga resmi Sol juga 60% lebih rendah dari Astra. Keunggulan biaya Astra Low per tugas muncul karena token yang dipakai jauh lebih sedikit pada evaluasi itu, bukan jaminan universal.[5][6][1]
Repository nyata memiliki sistem build, aturan internal, tools, permission, dan sejarah aneh yang tidak sepenuhnya tertangkap benchmark.
Benchmark adalah peta, bukan meteran anak tangga di depan rumahmu.
8. Aturan praktis — mulai dari Low, naik hanya jika ada bukti
| Situasi | Rekomendasi |
|---|---|
| Memulai tugas normal | Astra Low |
| Instruksi dan akses lengkap, tapi requirement inti terlewat sekali | Astra Medium |
| Medium masih melewatkan inti / arsitektur sulit | Astra High |
| High belum menutup masalah / biaya gagal sangat tinggi / root cause tersulit | Astra xhigh |
| Bagian sulit selesai dan pekerjaan kembali normal | Kembali ke Low |
Ini mencegah pemborosan allowance sejak awal dan juga mencegah pengulangan kegagalan yang sama karena terlalu setia pada Low.
Anggap effort sebagai gigi transmisi, bukan kepribadian.
9. Kesimpulan — “Astra Low terus?” Default ya; dikunci selamanya, tidak
Berdasarkan data publik 12 September 2026, memulai pekerjaan Codex sehari-hari dengan Astra Low adalah strategi yang sangat kuat.
Ia mengungguli Sol xhigh pada indeks agregat dan Terminal-Bench, serta lebih murah per tugas pada evaluasi tersebut.[1]
OpenAI juga menyarankan Low atau Medium sebagai titik awal dan mengingatkan bahwa effort lebih tinggi tidak menjamin jawaban lebih baik.[8]
Cara operasional paling sederhana:
Low untuk normal → Medium saat muncul kompleksitas atau kegagalan nyata → High bila Medium belum menutup masalah → xhigh hanya untuk yang tersulit → kembali ke Low setelah selesai.
Jangan tertipu namanya.
Astra Low berwajah mode hemat, tetapi bermain di skuad utama.
- Artificial Analysis — GPT-6 Astra (low) vs GPT-5.6 Sol (xhigh) artificialanalysis.ai
- Artificial Analysis — GPT-6 Astra (medium) vs GPT-5.6 Sol (xhigh) artificialanalysis.ai
- Artificial Analysis — GPT-6 Astra (high) vs GPT-5.6 Sol (xhigh) artificialanalysis.ai
- Artificial Analysis — GPT-6 Astra (xhigh) vs GPT-5.6 Sol (xhigh) artificialanalysis.ai
- OpenAI API — GPT-6 Astra Model developers.openai.com
- OpenAI API — GPT-5.6 Sol Model developers.openai.com
- OpenAI Help Center — ChatGPT Rate Card (Business, Enterprise/Edu credit-based pricing) help.openai.com
- OpenAI Help Center — Managing usage with GPT-6 Astra in Work and Codex help.openai.com
