Paket AI US$200 mengurangi nilai kuota? Justru sekarang saatnya mengubah kecerdasan murah menjadi infrastruktur

Cara memakai fitur membaca

Dengarkan membacakan artikel. Baca cepat menampilkan frasa berurutan dengan kecepatan pilihan Anda. Latihan bahasa membandingkan terjemahan yang tersedia. Simpan menambahkan penanda di browser ini; buka kembali dari daftar tersimpan di pemutar.

Bagikan artikel ini

Bagikan artikel ini

Iklan
Iklan

Menunggu pengumuman besar pada hari Selasa lalu menerima tulisan panjang tentang perubahan aturan penggunaan lebih dulu memang terasa aneh.

Pada 29 September 2026, Tibo mengatakan Pro US$200 akan dibuka kembali untuk pelanggan baru pada 30 September, tetapi cara hitung baru akan setara dengan kira-kira setengah nilai pengeluaran API dibanding Pro US$200 lama.[1]

Rasanya seperti menunggu kembang api lalu menerima revisi tagihan utilitas terlebih dahulu.

Namun ini bukan berarti semua model otomatis mendapat setengah jumlah pesan. Pada minggu yang sama, OpenAI mengumumkan harga API GPT-6 Sol dan Luna 50% lebih rendah daripada harga promosi GPT-5.6.[2][3]

Logika penyedia adalah:

kurangi kuota dalam ekuivalen dolar API, turunkan biaya model, lalu tetap tingkatkan pekerjaan yang dapat diselesaikan.

Secara matematika itu bisa terjadi.

Tetapi pelanggan tidak membeli "dolar API". Mereka membeli pekerjaan yang selesai.

1. Apa yang sebenarnya dipotong setengah?

Posting Tibo menyatakan Pro $200 akan dibuka lagi pada 30 September dan metode usage baru akan menghasilkan sekitar separuh API spend dari paket lama.[1]

Ia juga mengatakan batas lima jam tidak akan dikembalikan, kuota mingguan tetap bisa digunakan kapan saja, dan peningkatan efisiensi serta penurunan harga API akan diteruskan ke pelanggan. Ada pula fitur baru yang tidak memotong usage.[1]

GPT-6 Sol dan Luna yang diumumkan pada 22 September secara resmi memiliki harga API 50% lebih rendah daripada harga promosi GPT-5.6.[2] Halaman harga resmi menampilkan tarif saat ini.[3]

Jika anggaran lama B dan satu pekerjaan berbiaya C, throughput lama sekitar B/C.

Jika anggaran baru 0,5B dan biaya pekerjaan yang sama turun menjadi 0,5C:

0,5B ÷ 0,5C = B ÷ C

Secara teori, throughput tetap.

Masalahnya, pekerjaan AI nyata tidak seragam.

2. Pengguna menghitung pekerjaan selesai, bukan dolar abstrak

Seratus pertanyaan singkat tidak sama dengan satu perbaikan repositori besar.

Konteks panjang, reasoning mendalam, tool call, pengujian, retry, dan loop agent dapat membuat satu pekerjaan sangat mahal.

Pertanyaan penting bagi heavy user adalah:

berapa pekerjaan besar yang benar-benar dapat diselesaikan minggu ini?

Metrik praktisnya lebih dekat ke:

pekerjaan selesai ÷ biaya langganan bulanan

Model yang sangat pintar tetap kurang berguna jika bahan bakarnya habis di tengah pekerjaan.

3. "Terasa cuma seperseratus Opus" bukan benchmark, tetapi struktur keluhannya nyata

Dalam pekerjaan agent yang panjang, perbedaan limit antar layanan dapat terasa ekstrem.

Satu layanan bisa menjalankan beberapa tugas panjang, sementara layanan lain terasa hampir habis setelah satu pekerjaan besar.

"Seperseratus" jelas bukan rasio terukur. Hasil bergantung pada tugas, paket, model, dan panjang konteks.

Namun isu utamanya adalah apakah ukuran pekerjaan cocok dengan desain limit.

Pekerjaan lima menit masih mudah dibagi.

Pekerjaan tiga puluh menit, satu jam, atau beberapa putaran perbaikan dan tes sangat terganggu jika berhenti di tengah.

Nilai model karena itu juga bergantung pada:

  • apakah satu pekerjaan bisa selesai penuh;
  • apakah bisa dilanjutkan setelah gagal;
  • berapa pekerjaan selesai per minggu;
  • apakah model bisa diganti tanpa membangun ulang.

4. Ini masa membangun mesin, bukan hanya mengonsumsi AI

Tidak ada yang tahu apakah langganan AI saat ini akan menjadi lebih mahal, lebih murah, atau sekadar berubah.

Yang jelas, aturan penggunaan bukan aset tetap.

Menggunakan inferensi murah hanya untuk percakapan yang hasilnya tertinggal di riwayat chat adalah cara paling lemah memanfaatkan kesempatan ini.

Lebih kuat jika inferensi hari ini dipakai untuk mengurangi kebutuhan inferensi besok:

  • otomatisasi riset berulang;
  • simpan kriteria sebagai aturan eksplisit;
  • ubah inspeksi manual menjadi tes dan evaluator;
  • pecah pekerjaan raksasa menjadi tahap yang dapat dilanjutkan;
  • simpan artefak, bukti, dan status di luar chat;
  • letakkan perbedaan vendor di adapter tipis;
  • catat model mana yang berhasil untuk tiap jenis pekerjaan.

Intinya:

sewa AI murah sekarang untuk membangun pabrik yang tetap berjalan ketika AI yang sama tidak lagi murah.

5. Pisahkan konsumsi yang hilang dari aset yang bertahan

Konsumsi sesaat Aset bertahan
Menjelaskan konteks berulang Menyimpan spesifikasi dan aturan
Meminta inspeksi manual Membuat tes dan evaluator
Satu prompt raksasa Tahapan dengan checkpoint
Membaca jawaban lalu selesai Menyimpan artefak, bukti, status
Model terkuat untuk semuanya Model murah dulu, eskalasi bila perlu
Prompt magis khusus vendor Kontrak umum + adapter tipis
Limit habis lalu berhenti Retry, resume, handoff

FrugalGPT menunjukkan bahwa cascade yang memilih model berbeda per kueri dapat, pada tugas yang diuji, mendekati model tunggal terbaik dengan biaya jauh lebih rendah.[4]

Penelitian routing hemat biaya tahun 2026 juga memakai model yang lebih efisien terlebih dahulu lalu mengeskalasi hanya keluaran berkualitas rendah, dan melaporkan 97–99% akurasi model terkuat pada evaluasinya.[5]

6. Arsitektur minimum yang mudah pindah vendor

Tidak perlu program multicloud besar.

Pisahkan enam hal:

  1. Kontrak pekerjaan — input, output, dan definisi selesai tanpa nama model.
  2. Adapter vendor — perbedaan API dikumpulkan di satu tempat.
  3. Penyimpanan status — catat pekerjaan berhenti di mana.
  4. Penyimpanan artefak — kode, dokumen, dan bukti di luar percakapan.
  5. Evaluator — uji apakah "selesai" benar-benar selesai.
  6. Router — mulai dari model termurah yang cukup, naikkan hanya bila perlu.

Panduan Well-Architected Microsoft juga menyarankan mengurangi dependensi yang terlalu erat dan memisahkan logika domain dari fungsi infrastruktur khusus.[6]

7. Apa yang sebaiknya dibangun model kuat selagi murah?

Prioritaskan hasil yang terus memberi nilai setelah sesi selesai:

  • otomatisasi riset, tes, publikasi, dan laporan berulang;
  • retry, resume, checkpoint, idempotensi, dan deduplikasi;
  • kriteria kualitas yang dapat diuji;
  • observability untuk jenis tugas, model, keberhasilan, retry, durasi, dan usage;
  • pintu untuk mengganti vendor di masa depan.

Dengan begitu, perubahan harga menjadi perubahan routing, bukan proyek pembangunan ulang.

8. Optimasi yang cepat menua

Jangan jadikan "menghabiskan semua kuota" sebagai tujuan. Usage bukan output.

Jangan terlalu bergantung pada pekerjaan raksasa sekali jalan.

Jangan menumpuk trik prompt yang hanya berlaku pada satu vendor.

Dan tidak perlu menebak perusahaan mana yang pasti menaikkan harga.

Lebih baik membuat sistem yang tetap hidup di beberapa kemungkinan masa depan.

9. Kesimpulan — kemurahan langganan adalah cuaca; sistem adalah rumah

Wajar kesal ketika ekonomi paket US$200 berubah.

Wajar pula melihat layanan lain dan merasa jauh lebih banyak pekerjaan nyata bisa diselesaikan di sana.

Tetapi jika produktivitas bergantung pada tabel harga hari ini, setiap pengumuman vendor menjadi insiden operasional.

Strategi yang lebih kuat adalah mengubah kecerdasan murah hari ini menjadi modal tahan lama:

kode, tes, evaluator, data, otomatisasi, workflow yang dapat dilanjutkan, dan adapter model yang bisa diganti.

Jangan menganggap model terbaik hari ini akan selalu terbaik.

Jangan menganggap langganan murah hari ini akan selalu murah.

Bangun sekarang sistem yang tetap bekerja setelah era murah selesai.

Itulah nilai terbesar dari kesempatan ini.


  1. Tibo (@thsottiaux), X post, 2026-09-29, announcing the 2026-09-30 reopening of Pro $200 and the new usage calculation x.com
  2. OpenAI, “Introducing GPT-6 Sol and Luna”, 2026-09-22 openai.com
  3. OpenAI API, “Pricing”, checked 2026-09-29 developers.openai.com
  4. Chen, Lingjiao; Zaharia, Matei; Zou, James, “FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance”, Transactions on Machine Learning Research, 2024 openreview.net
  5. Moslem, Yasmin et al., “Cluster, Route, Escalate: Cascaded Framework for Cost-Aware LLM Serving”, arXiv, 2026 arxiv.org
  6. Microsoft Azure Well-Architected Framework, guidance on reducing tightly coupled dependencies and separating domain logic from infrastructure concerns, checked 2026-09-29 learn.microsoft.com

Bagikan artikel ini

Iklan

Cari artikel lain

Semua artikel

Mendoi-chan

Ditulis oleh

Mendoi-chan

Mengubah kerepotan di tempat kerja dan kehidupan sehari-hari menjadi struktur yang jelas dan langkah berikutnya.

Tentang situs
Iklan

Artikel terbaru

  1. 1Saat Zero Mundur, Ksatria Hitam Seharusnya Ikut Mundur|Todo dan Batas Organisasi yang Terlalu Bergantung pada Zero
  2. 2Neraka bagi penonton yang harus menunggu dari Episode 25 musim pertama hingga R2|Dari akhir dengan pistol saling terarah hingga awal dengan ingatan yang diubah
  3. 3Blue Moon bukan Bulan yang berwarna biru
  4. 4Ketika kecantikan tidak lagi mengendalikan keputusan: hilangnya urgensi romantis dan munculnya prioritas pada kecocokan serta desain hidup
  5. 5“Katanya aku nggak pernah balas” padahal selalu membalas — apa yang terjadi ketika mesin percakapan dibebankan ke satu orang

Baca juga

Iklan