TL;DR
Belakangan saya melihat kembali cara saya memakai AI dan menyadari sesuatu yang agak lucu.
Saya hampir tidak pernah memberi langkah kerja yang sangat rinci.
Instruksinya biasanya cuma sekitar: “saya ingin menang”, “kurangi pekerjaan saya”, “jangan berhenti di tengah”, “cek apakah benar-benar sudah selesai”.
Kasarnya bukan main.
Namun kalau AI benar-benar diminta memenuhi tujuan yang sekasar itu, ia terpaksa memecah syarat, menentukan arti “selesai”, merancang cara verifikasi, lalu menambah aturan pengaman di tempat yang pernah gagal.
Akhirnya alurnya bergeser dari “manusia memeriksa semuanya setiap kali” menjadi: AI mengerjakan, AI memeriksa, hasilnya dicocokkan dengan bukti eksternal, lalu manusia hanya menerima laporan kalau ada masalah.
Setelah saya cari tahu, pola ini ternyata cukup mirip dengan konsep pengembangan berbasis agen yang disebut Harness Engineering, yang dipublikasikan OpenAI pada 2026.
Manusia menentukan niat dan batas. Agen AI menjalankan.
Masalahnya, cara ini sangat kuat untuk proyek pribadi, tetapi mendadak jauh lebih sulit ketika dibawa ke perusahaan.
Proyek pribadi adalah negara diktator tanpa politik.
Begitu masuk perusahaan, parlemen langsung bersidang.
Titik awalnya cuma dua: ingin lebih sering menang dan ingin bekerja lebih sedikit
Tujuan tingkat atasnya sangat sederhana.
Kalau soal game kartu, saya ingin menang.
Kalau soal artikel atau otomatisasi, saya ingin mengurangi pekerjaan saya sendiri.
Dua tujuan ini kuat karena tetap sederhana walaupun teknologi di bawahnya makin rumit.
Boleh membuat simulator, menjalankan ribuan pertandingan, dan menambahkan algoritma pencarian.
Pada akhirnya pertanyaannya tetap: “Jadi, tingkat kemenangan naik tidak?”
Boleh mengotomatisasi artikel, membuat banyak bahasa, menambah pemeriksaan mutu, antrean kerja, sidik data untuk membedakan versi, dan percobaan ulang ketika gagal.
Pada akhirnya pertanyaannya tetap: “Jadi, pekerjaan saya berkurang tidak?”
Implementasi boleh menjadi rumit tanpa membuat tujuan ikut rumit.
Karena tujuan stabil, saya bisa memberi AI kebebasan yang cukup besar dalam memilih cara.
Saya tidak mengunci setiap langkah. Kalau perlu, AI saya minta menurunkan sendiri seperti apa kondisi yang seharusnya
Manusia tidak harus merancang semua kriteria selesai dari nol setiap kali.
Cukup mulai dari tujuan seperti:
“Bawa artikel terbaru sampai benar-benar terbit dalam kondisi yang benar, tanpa campur tangan manusia.”
Dari sana AI bisa memecah pertanyaan seperti:
- apa yang dimaksud “terbaru”
- apa arti “benar”
- apakah terjemahan masih cocok dengan naskah sumber saat ini
- apakah tugas 50 item boleh dianggap selesai setelah hanya satu item berhasil
- apakah masuk GitHub sudah bisa disebut “terbit”
- apakah situs yang benar-benar tayang juga perlu diperiksa
Jadi manusia terutama memegang tujuan dan syarat yang tidak boleh dilanggar. Kriteria penerimaan yang lebih rinci bisa diturunkan oleh AI.
Tentu saja AI juga bisa salah membuat kriterianya.
Karena itu langkah berikutnya adalah verifikasi.
Saya memakai AI banyak sekali, tapi “AI bilang sudah selesai” bukan bukti
Dari luar, cara ini bisa terlihat seperti menyerahkan semuanya kepada AI.
Dan memang cukup dekat: pengerjaan saya delegasikan ke AI, pemeriksaan juga saya delegasikan ke AI.
Kalau bisa, saya bahkan tidak ingin membaca catatan prosesnya.
Alur idealnya:
kerjakan → periksa otomatis → kalau normal, laporkan singkat → kalau bermasalah, bawa hanya penyebab dan usulan perbaikannya.
Yang penting, pengakuan AI sendiri tidak boleh menjadi syarat selesai.
“Sudah selesai” belum cukup. Kita perlu mengambil hal yang dapat diamati dari luar: jumlah yang diproses, hasil tes, sidik data, file nyata di GitHub, alamat situs nyata, atau HTML yang benar-benar disajikan di lingkungan produksi.
Kalau model yang sama, dengan konteks yang sama, diminta “cek pekerjaanmu sendiri”, ia bisa saja mengulang salah paham yang sama dua kali.
Karena itu struktur yang lebih kuat memisahkan pembuatan, pemeriksaan, dan bukti eksternal.
Manusia tidak perlu membaca semuanya.
Tetapi juga jangan berhenti pada kalimat “sudah saya cek”.
Versi kasarnya:
“Saya tidak mau lihat. Kamu yang cek. Tapi bawa buktinya.”
Setiap titik tersandung adalah tempat di mana kerja manusia masih tersisa
Kalau tujuan sebenarnya memang mengurangi pekerjaan, langkah manual kecil yang tadinya terasa wajar mulai terlihat mengganggu.
Di sini seseorang harus menekan tombol setiap kali.
Kasus khusus ini hanya bisa diputuskan manusia.
Kalau gagal, manusia harus membuka catatan proses.
Sesudah terbit, manusia masih harus mengecek manual.
Reaksi biasa adalah: “Ya sudah, bagian kecil ini manual saja.”
Tetapi kalau tujuannya memang mengurangi pekerjaan, itu berarti desainnya belum selesai.
Kalau sebuah proses hanya berjalan karena manusia harus berusaha di satu titik, titik itu masih merupakan utang desain.
Dengan cara pandang ini, kegagalan bukan sekadar insiden.
Kalau seharusnya memproses 50 item tetapi dianggap sukses setelah satu item, jangan hanya menjalankan 49 sisanya.
Pertanyaannya adalah: “Kenapa satu item bisa dianggap sebagai penyelesaian normal?”
Kalau terjemahan lama dianggap versi terbaru, jangan hanya memperbaiki terjemahan itu.
Ubah sistem agar terjemahan lama tidak lagi bisa lolos sebagai valid.
Setiap kegagalan yang naik kelas menjadi aturan akan sedikit demi sedikit menghapus kerja manusia di masa depan.
Atasan yang berkata “saya tidak paham” masih bisa diperbaiki. Yang berbahaya adalah penilaian yang mengubah realitas
Pada Agustus 2026, sebuah artikel di Zenn menceritakan tim yang produktivitasnya menjadi tiga kali lipat setelah memakai AI, tetapi pada saat yang sama meninggalkan sebagian anggota tim.
Salah satu adegan yang paling mencolok adalah respons seorang atasan yang kurang lebih berkata: “Saya belum benar-benar memahami ini, tapi saya rasa yang Anda katakan benar.”
Sebagai penilaian teknis, itu lemah.
Tetapi ada kondisi manajemen yang jauh lebih buruk.
Tidak memahami sesuatu, lalu mengubah fakta atau kriteria setelah hasil keluar demi mempertahankan posisi sebagai pihak yang lebih tinggi.
Sebelumnya tidak ada standar, tetapi setelah hasil muncul keluar kalimat “ya jelas seharusnya begini”.
Kalau bertanya, jawabannya “pikir sendiri”; kalau bergerak sendiri, jawabannya “jangan bertindak sepihak”.
Di lingkungan seperti itu, tidak ada permainan untuk mendekati jawaban yang benar karena jawaban “benar” itu sendiri terus berpindah.
Sebaliknya, kalau seseorang bisa mengakui “saya belum mampu menilai ini”, sistem masih bisa diperbaiki: tambahkan ahli, otomatisasikan pemeriksaan, wajibkan dasar keputusan dan daftar hal yang belum diverifikasi.
Kekurangan pengetahuan bisa ditutup.
Kriteria penilaian yang bergerak setelah kejadian justru merusak mekanisme jaminan mutu itu sendiri.
Sekarang saya lebih paham kenapa QC yang berubah jadi ritual terasa menyebalkan
Tujuan asli kegiatan kendali mutu kelompok kecil, yang dikenal sebagai QC Circle, adalah agar orang-orang di lini depan terus memperbaiki kualitas dan cara kerja.
Union of Japanese Scientists and Engineers juga menjelaskan QC Circle sebagai aktivitas berkelanjutan untuk mengendalikan dan memperbaiki pekerjaan oleh orang-orang di lini depan.
Masalahnya bukan kegiatan kendali mutu itu sendiri.
Masalah muncul ketika “memperbaiki sesuatu” diganti menjadi “menyelesaikan bentuk bahwa kita sudah melakukan QC”.
Pilih tema.
Buat grafik.
Masukkan ke alur QC Story.
Buat bahan presentasi.
Dinilai.
Tepuk tangan.
Selesai.
Itu bukan perbaikan berkelanjutan lagi. Itu lomba cosplay perbaikan berkelanjutan.
Sebaliknya, siklus yang muncul ketika bekerja dengan agen AI justru jauh lebih kotor dan praktis.
Gagal.
Cari penyebab.
Cari kondisi reproduksi.
Perbaiki syarat selesai atau pemeriksaannya.
Jalankan lagi.
Pastikan kegagalan yang sama tidak bisa lagi menyamar sebagai “sukses”.
Tidak ada presentasi cantik.
Tetapi pada putaran berikutnya, kerja manusia memang berkurang.
Ironisnya, itu justru lebih dekat dengan semangat asli perbaikan berkelanjutan.
Tanpa sadar, saya cukup dekat dengan Harness Engineering milik OpenAI
Pada Februari 2026, OpenAI menerbitkan Harness Engineering, yang menjelaskan cara pengembangan berpusat pada agen AI dan Codex.
Dalam eksperimen internal tersebut, tim menetapkan batasan nol baris kode yang ditulis manual dan memperkirakan produk itu dibangun kira-kira dalam sepersepuluh waktu dibanding jika semuanya ditulis tangan.
Tetapi bagian yang paling menarik bukan hanya kecepatannya.
Perubahan pentingnya adalah pekerjaan manusia bergeser dari menulis kode menjadi merancang lingkungan, menyatakan niat, dan membangun siklus umpan balik.
OpenAI juga menjelaskan bahwa batas penting seperti batas operasi, ketepatan, dan keterulangan sebaiknya ditegakkan secara terpusat, sementara agen diberi banyak kebebasan di dalam batas tersebut.
Ini sangat mirip dengan gaya di sini.
Tidak perlu mengatur sampai detail kecil tentang “cara mengimplementasikan”.
Yang perlu jelas adalah “ini tidak boleh dilanggar”.
Ketika ada kegagalan, kegagalan itu diubah menjadi dokumentasi, tes, pemeriksaan otomatis, atau aturan alat untuk putaran berikutnya.
Motivasi awalnya mungkin sesederhana “detailnya merepotkan, saya tidak mau melihat”, tetapi hasil akhirnya adalah membangun tempat berpijak agar agen bisa bergerak sendiri.
Saya tidak sampai di sini setelah membaca teorinya.
Saya mengambil jalur kemalasan dan ternyata naik ke gunung yang sama.
Lumayan lucu.
Proyek pribadi adalah negara diktator tanpa politik. Di perusahaan, parlemen dibuka
Dalam proyek pribadi, metode ini sangat kuat.
Pemiliknya saya.
Penggunanya saya.
Penilainya saya.
Yang menentukan arti sukses juga saya.
Kalau ingin menang di game kartu, lihat apakah saya menang lebih sering.
Kalau ingin bekerja lebih sedikit, lihat apakah intervensi manusia berkurang.
Karena fungsi tujuan hampir hanya satu, sistem serumit apa pun yang dibuat AI akhirnya bisa dikembalikan ke dua pertanyaan sederhana:
Apakah ini membuat saya lebih sering menang?
Apakah pekerjaan saya berkurang?
Proyek pribadi adalah kediktatoran tanpa politik.
Dan diktatornya malas, jadi birokrasi AI terus mengotomatisasi semuanya.
Di perusahaan, tujuan lain langsung bermunculan.
“Kurangi jam kerja” bertemu dengan kebiasaan operasi, audit, hak persetujuan, sistem lama, tanggung jawab, evaluasi, bahkan alasan keberadaan sebuah departemen.
Harvard Business Review, ketika membahas adopsi AI di perusahaan pada 2025, merangkum banyak hambatannya sebagai masalah orang, proses, dan politik, bukan hanya teknologi.
Dalam proyek pribadi, kita menentukan kondisi yang diinginkan lalu membiarkan AI mengoptimalkan.
Di perusahaan, menentukan kondisi yang diinginkan itu sendiri sudah menjadi negosiasi.
Dan tidak semua politik itu bodoh.
Mempertahankan persetujuan manusia demi audit atau akuntabilitas bisa sangat masuk akal.
Mempertahankannya hanya karena seseorang tidak mau kehilangan wewenang adalah hal lain.
Bagi AI, keduanya terlihat sama: “butuh persetujuan manusia”.
Menentukan apakah batasan itu benar-benar perlu tetap menjadi masalah masyarakat manusia.
Pada akhirnya, mungkin manusia hanya perlu memegang dua hal: tujuan dan realitas
Di era AI, manusia tidak selalu perlu merancang semua langkah, mengimplementasikan semuanya, lalu memeriksa semua hasil sendiri.
Tentukan tujuan.
Biarkan AI menurunkan kondisi ideal dan kriterianya.
Biarkan AI mengimplementasikan.
Biarkan AI memeriksa.
Cocokkan dengan bukti eksternal.
Kalau gagal, ubah kegagalan itu menjadi aturan untuk putaran berikutnya.
Kalau kerja manusia masih tersisa, jadikan titik itu target perbaikan berikutnya.
Kalau siklus ini bisa berjalan stabil, kebutuhan manusia untuk memahami setiap detail implementasi akan berkurang banyak.
Tetapi masih ada dua pertanyaan yang sulit benar-benar didelegasikan:
Apa sebenarnya yang ingin kita capai?
Apakah tujuan itu cocok dengan realitas?
Mungkin pembagian perannya akan makin mendekati bentuk ini:
Manusia: menentukan tujuan dan melihat realitas.
AI: mengisi semua yang ada di antaranya.
Untuk proyek pribadi, sangat nyaman.
Di perusahaan, parlemen bersidang.
Politik masih kuat.
