Menunggu pengumuman besar pada hari Selasa lalu menerima tulisan panjang tentang perubahan aturan penggunaan lebih dulu memang terasa aneh.
Pada 29 September 2026, Tibo mengatakan Pro US$200 akan dibuka kembali untuk pelanggan baru pada 30 September, tetapi cara hitung baru akan setara dengan kira-kira setengah nilai pengeluaran API dibanding Pro US$200 lama.[1]
Rasanya seperti menunggu kembang api lalu menerima revisi tagihan utilitas terlebih dahulu.
Namun ini bukan berarti semua model otomatis mendapat setengah jumlah pesan. Pada minggu yang sama, OpenAI mengumumkan harga API GPT-6 Sol dan Luna 50% lebih rendah daripada harga promosi GPT-5.6.[2][3]
Logika penyedia adalah:
kurangi kuota dalam ekuivalen dolar API, turunkan biaya model, lalu tetap tingkatkan pekerjaan yang dapat diselesaikan.
Secara matematika itu bisa terjadi.
Tetapi pelanggan tidak membeli "dolar API". Mereka membeli pekerjaan yang selesai.
1. Apa yang sebenarnya dipotong setengah?
Posting Tibo menyatakan Pro $200 akan dibuka lagi pada 30 September dan metode usage baru akan menghasilkan sekitar separuh API spend dari paket lama.[1]
Ia juga mengatakan batas lima jam tidak akan dikembalikan, kuota mingguan tetap bisa digunakan kapan saja, dan peningkatan efisiensi serta penurunan harga API akan diteruskan ke pelanggan. Ada pula fitur baru yang tidak memotong usage.[1]
GPT-6 Sol dan Luna yang diumumkan pada 22 September secara resmi memiliki harga API 50% lebih rendah daripada harga promosi GPT-5.6.[2] Halaman harga resmi menampilkan tarif saat ini.[3]
Jika anggaran lama B dan satu pekerjaan berbiaya C, throughput lama sekitar B/C.
Jika anggaran baru 0,5B dan biaya pekerjaan yang sama turun menjadi 0,5C:
0,5B ÷ 0,5C = B ÷ C
Secara teori, throughput tetap.
Masalahnya, pekerjaan AI nyata tidak seragam.
2. Pengguna menghitung pekerjaan selesai, bukan dolar abstrak
Seratus pertanyaan singkat tidak sama dengan satu perbaikan repositori besar.
Konteks panjang, reasoning mendalam, tool call, pengujian, retry, dan loop agent dapat membuat satu pekerjaan sangat mahal.
Pertanyaan penting bagi heavy user adalah:
berapa pekerjaan besar yang benar-benar dapat diselesaikan minggu ini?
Metrik praktisnya lebih dekat ke:
pekerjaan selesai ÷ biaya langganan bulanan
Model yang sangat pintar tetap kurang berguna jika bahan bakarnya habis di tengah pekerjaan.
3. "Terasa cuma seperseratus Opus" bukan benchmark, tetapi struktur keluhannya nyata
Dalam pekerjaan agent yang panjang, perbedaan limit antar layanan dapat terasa ekstrem.
Satu layanan bisa menjalankan beberapa tugas panjang, sementara layanan lain terasa hampir habis setelah satu pekerjaan besar.
"Seperseratus" jelas bukan rasio terukur. Hasil bergantung pada tugas, paket, model, dan panjang konteks.
Namun isu utamanya adalah apakah ukuran pekerjaan cocok dengan desain limit.
Pekerjaan lima menit masih mudah dibagi.
Pekerjaan tiga puluh menit, satu jam, atau beberapa putaran perbaikan dan tes sangat terganggu jika berhenti di tengah.
Nilai model karena itu juga bergantung pada:
- apakah satu pekerjaan bisa selesai penuh;
- apakah bisa dilanjutkan setelah gagal;
- berapa pekerjaan selesai per minggu;
- apakah model bisa diganti tanpa membangun ulang.
4. Ini masa membangun mesin, bukan hanya mengonsumsi AI
Tidak ada yang tahu apakah langganan AI saat ini akan menjadi lebih mahal, lebih murah, atau sekadar berubah.
Yang jelas, aturan penggunaan bukan aset tetap.
Menggunakan inferensi murah hanya untuk percakapan yang hasilnya tertinggal di riwayat chat adalah cara paling lemah memanfaatkan kesempatan ini.
Lebih kuat jika inferensi hari ini dipakai untuk mengurangi kebutuhan inferensi besok:
- otomatisasi riset berulang;
- simpan kriteria sebagai aturan eksplisit;
- ubah inspeksi manual menjadi tes dan evaluator;
- pecah pekerjaan raksasa menjadi tahap yang dapat dilanjutkan;
- simpan artefak, bukti, dan status di luar chat;
- letakkan perbedaan vendor di adapter tipis;
- catat model mana yang berhasil untuk tiap jenis pekerjaan.
Intinya:
sewa AI murah sekarang untuk membangun pabrik yang tetap berjalan ketika AI yang sama tidak lagi murah.
5. Pisahkan konsumsi yang hilang dari aset yang bertahan
| Konsumsi sesaat | Aset bertahan |
|---|---|
| Menjelaskan konteks berulang | Menyimpan spesifikasi dan aturan |
| Meminta inspeksi manual | Membuat tes dan evaluator |
| Satu prompt raksasa | Tahapan dengan checkpoint |
| Membaca jawaban lalu selesai | Menyimpan artefak, bukti, status |
| Model terkuat untuk semuanya | Model murah dulu, eskalasi bila perlu |
| Prompt magis khusus vendor | Kontrak umum + adapter tipis |
| Limit habis lalu berhenti | Retry, resume, handoff |
FrugalGPT menunjukkan bahwa cascade yang memilih model berbeda per kueri dapat, pada tugas yang diuji, mendekati model tunggal terbaik dengan biaya jauh lebih rendah.[4]
Penelitian routing hemat biaya tahun 2026 juga memakai model yang lebih efisien terlebih dahulu lalu mengeskalasi hanya keluaran berkualitas rendah, dan melaporkan 97–99% akurasi model terkuat pada evaluasinya.[5]
6. Arsitektur minimum yang mudah pindah vendor
Tidak perlu program multicloud besar.
Pisahkan enam hal:
- Kontrak pekerjaan — input, output, dan definisi selesai tanpa nama model.
- Adapter vendor — perbedaan API dikumpulkan di satu tempat.
- Penyimpanan status — catat pekerjaan berhenti di mana.
- Penyimpanan artefak — kode, dokumen, dan bukti di luar percakapan.
- Evaluator — uji apakah "selesai" benar-benar selesai.
- Router — mulai dari model termurah yang cukup, naikkan hanya bila perlu.
Panduan Well-Architected Microsoft juga menyarankan mengurangi dependensi yang terlalu erat dan memisahkan logika domain dari fungsi infrastruktur khusus.[6]
7. Apa yang sebaiknya dibangun model kuat selagi murah?
Prioritaskan hasil yang terus memberi nilai setelah sesi selesai:
- otomatisasi riset, tes, publikasi, dan laporan berulang;
- retry, resume, checkpoint, idempotensi, dan deduplikasi;
- kriteria kualitas yang dapat diuji;
- observability untuk jenis tugas, model, keberhasilan, retry, durasi, dan usage;
- pintu untuk mengganti vendor di masa depan.
Dengan begitu, perubahan harga menjadi perubahan routing, bukan proyek pembangunan ulang.
8. Optimasi yang cepat menua
Jangan jadikan "menghabiskan semua kuota" sebagai tujuan. Usage bukan output.
Jangan terlalu bergantung pada pekerjaan raksasa sekali jalan.
Jangan menumpuk trik prompt yang hanya berlaku pada satu vendor.
Dan tidak perlu menebak perusahaan mana yang pasti menaikkan harga.
Lebih baik membuat sistem yang tetap hidup di beberapa kemungkinan masa depan.
9. Kesimpulan — kemurahan langganan adalah cuaca; sistem adalah rumah
Wajar kesal ketika ekonomi paket US$200 berubah.
Wajar pula melihat layanan lain dan merasa jauh lebih banyak pekerjaan nyata bisa diselesaikan di sana.
Tetapi jika produktivitas bergantung pada tabel harga hari ini, setiap pengumuman vendor menjadi insiden operasional.
Strategi yang lebih kuat adalah mengubah kecerdasan murah hari ini menjadi modal tahan lama:
kode, tes, evaluator, data, otomatisasi, workflow yang dapat dilanjutkan, dan adapter model yang bisa diganti.
Jangan menganggap model terbaik hari ini akan selalu terbaik.
Jangan menganggap langganan murah hari ini akan selalu murah.
Bangun sekarang sistem yang tetap bekerja setelah era murah selesai.
Itulah nilai terbesar dari kesempatan ini.
- Tibo (@thsottiaux), X post, 2026-09-29, announcing the 2026-09-30 reopening of Pro $200 and the new usage calculation x.com
- OpenAI, “Introducing GPT-6 Sol and Luna”, 2026-09-22 openai.com
- OpenAI API, “Pricing”, checked 2026-09-29 developers.openai.com
- Chen, Lingjiao; Zaharia, Matei; Zou, James, “FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance”, Transactions on Machine Learning Research, 2024 openreview.net
- Moslem, Yasmin et al., “Cluster, Route, Escalate: Cascaded Framework for Cost-Aware LLM Serving”, arXiv, 2026 arxiv.org
- Microsoft Azure Well-Architected Framework, guidance on reducing tightly coupled dependencies and separating domain logic from infrastructure concerns, checked 2026-09-29 learn.microsoft.com
