AIに細かく指示しない。「勝ちたい」「作業を減らしたい」だけで回したら、検証まで自動化する仕組みになった

最近、自分のAIの使い方を振り返っていて、妙なことに気づいた。

TL;DR

最近、自分のAIの使い方を振り返っていて、妙なことに気づいた。

私はAIに細かい手順をほとんど指示していない。

だいたい言っているのは、「勝ちたい」「作業を減らしたい」「途中で止まるな」「本当にできたか確認しろ」くらいである。

雑。かなり雑。

ところが、その雑な目的を本気で満たそうとすると、AI側は勝手に条件を分解し、完了基準を作り、検証方法を考え、失敗した場所にガードレールを足していく。

結果として、人間が毎回細かく確認する運用ではなく、AIに作らせ、AIに確認させ、外部の証拠で照合し、異常だけ報告させる運用に近づいていった。

調べてみると、これはOpenAIが2026年に公開した「Harness Engineering」の考え方とかなり似ていた。

人間は意図と境界を決める。エージェントは実行する。

ただし、個人では強いこのやり方も、会社に持ち込むと急に難しくなる。

個人プロジェクトは政治ゼロの独裁国家。

会社に持ち込んだ瞬間、国会が開かれる。


出発点は「勝ちたい」と「作業を減らしたい」だけ

上位目的は驚くほど単純だ。

カードゲームなら、勝ちたい

記事や自動化なら、自分の作業を減らしたい

この2つは強い。

シミュレーターを作った。大量対戦を回した。探索アルゴリズムを入れた。

でも最終的には「それで勝率は上がったの?」で終わる。

記事処理を自動化した。多言語化した。QAを作った。キューやハッシュや再試行を入れた。

でも最終的には「俺の作業、減った?」で終わる。

技術は複雑になっても、目的は複雑にならない。

目的がぶれないから、具体的な手段をAIにかなり自由に任せられる。


細かい指示はしない。必要ならAIに「あるべき姿」から作らせる

人間が毎回、完了条件をゼロから設計する必要はない。

「最新の記事を、人手を挟まず、正しい状態で公開まで持っていく」

このくらいの目的を渡せば、AIにこう考えさせられる。

  • 何をもって「最新」とするのか
  • 何をもって「正しい」とするのか
  • 翻訳は現在の原文と対応しているか
  • 50件処理のつもりなのに1件だけ成功して終了してよいのか
  • GitHubに反映しただけで公開と言えるのか
  • 実サイトまで確認する必要があるか

つまり、人間が持つのは目的と不変条件で、細かい受入基準はAIに展開させる。

もちろん、AIが作った基準も間違える。

だから次に「検証」が要る。


AIをかなり使う。でも「AIができたと言った」は証拠にしない

一見すると、AIに丸投げしているように見える。

実際、作業もAIに投げるし、確認もAIに投げる。

本人はできればログも見たくない。

理想はこうだ。

作業する → 自動で検査する → 問題なしなら短く報告 → 異常なら原因と修正案だけ持ってくる。

ここで重要なのは、AIの自己申告をそのまま完了条件にしないことだ。

「できました」ではなく、件数、テスト結果、ハッシュ、GitHub上の実ファイル、実URL、実サイトHTMLなど、外から観測できるものを取りに行く。

同じAIに同じ文脈で「自分の仕事を確認して」と言うだけでは、同じ勘違いを二回する可能性がある。

だから強い形は、生成、検査、外部証拠を分けることになる。

人間が全部読む必要はない。

でも「確認しました」という一言だけで終わらせない。

雑に言えば、

「俺は見ない。お前が確認しろ。ただし証拠は持ってこい」

である。


躓きポイントは「まだ人間工数が残っている場所」

作業を本気で減らそうとすると、途中の小さな手作業が全部気になってくる。

毎回ここだけ押す。

この例外だけ人間が判断する。

失敗したら人間がログを見る。

公開後だけ人間が確認する。

普通なら「まあここだけ手作業でいいか」で終わる。

しかし目的が「作業を減らしたい」なら、そこは未完成である。

人間が頑張らないと成立しない工程を見つけたら、その工程の設計がまだ終わっていない。

この見方をすると、エラーは単なる事故ではなくなる。

1件で勝手に終了したなら、残り49件を足して終わりではない。

「なぜ1件で正常終了できたのか」を潰す。

古い翻訳を最新版として扱ったなら、その翻訳だけ直して終わりではない。

「どうすれば古い翻訳を正常扱いできなくなるか」を仕組みに入れる。

失敗がルールに昇格し続けると、人間の仕事は少しずつ消えていく。


「分からない上司」はまだマシ。怖いのは現実を書き換えるレビュー

2026年8月にZennで公開された「AIで生産性が3倍になった私たちが、チームを置き去りにした話」では、AI活用が進んだ結果、上司が内容を十分にレビューできなくなる状況が描かれている。

象徴的なのが、「すぐには理解できないが、正しいことを言っているのだと思う」という反応だ。

レビューとしては弱い。

しかし、管理としてもっと危険な状態がある。

分からないのに、上の立場を守るために事実や基準を後から変えることだ。

事前に基準がないのに、結果を見て「普通こうするだろ」と言う。

相談すると「自分で考えろ」、自分で進めると「勝手にやるな」と言う。

こうなると、正解へ近づくゲームそのものが成立しない。

一方で「自分には今レビューできない」と認められるなら、専門レビューを足す、検証項目を機械化する、根拠と未確認事項を出させる、といった修復ができる。

能力不足は補完できる。

判定基準が動くレビューは、品質保証装置そのものを壊す。


QCが嫌だった理由も、今なら少し分かる

QCサークルの本来の目的は、現場の小集団が継続的に品質や仕事を改善することにある。

日本科学技術連盟も、QCサークルを第一線の従業員による継続的な管理・改善活動として説明している。

問題はQCではない。

改善より「QCをやった形」を完成させることが目的になった瞬間である。

テーマを作る。

グラフを作る。

QCストーリーに当てはめる。

発表資料を作る。

審査する。

拍手する。

おわり。

これでは改善活動ではなく、改善活動コスプレ大会になってしまう。

対して、AIで今やっているループはかなり泥臭い。

失敗する。

原因を見る。

再発条件を探す。

終了条件や検査を直す。

もう一度回す。

同じ失敗が正常終了として通らないことを確認する。

発表資料はない。

だが、次回の人間工数は減る。

皮肉なことに、こちらの方がQCの「継続的改善」という原型には近い。


気づいたらOpenAIのHarness Engineeringにかなり近かった

OpenAIは2026年2月、「Harness Engineering」という記事で、Codexを使ったエージェント中心の開発方法を公開した。

そこでは、手書きコード0行という制約で内部製品を作り、従来なら必要だった時間のおよそ10分の1で構築できたと報告している。

重要なのは速度そのものではない。

人間の主な仕事が、コードを書くことから、環境を設計し、意図を指定し、フィードバックループを作ることへ移ったと説明している点だ。

さらにOpenAIは、境界、正確性、再現性のような重要な制約は中央で強制し、その中でエージェントには大きな自由を与えるとしている。

これはかなり近い。

「どう実装するか」は細かく言わない。

「ここは絶対に守れ」は決める。

失敗したら、その失敗をドキュメント、テスト、lint、ツールのルールとして次回に残す。

本人は「めんどいから細かく見たくない」だけでも、結果としてエージェントが自走できる足場を作る仕事になっていく。

思想から入ったのではなく、怠惰から同じ山に登っていた。

これはちょっと面白い。


個人プロジェクトは政治ゼロの独裁国家。会社では国会が開く

個人でやると、この方式は非常に強い。

オーナーは自分。

利用者も自分。

評価者も自分。

成功の定義者も自分。

「カードゲームで勝ちたい」なら、勝率が上がるかを見る。

「作業を減らしたい」なら、人間の介入が減るかを見る。

目的関数が一本なので、AIが出した複雑な実装も最後に簡単な問いへ戻せる。

それで勝てるの?

それで俺の作業減った?

個人プロジェクトは、政治ゼロの独裁国家である。

しかも独裁者が怠け者なので、官僚AIがどんどん自動化する。

ところが会社ではそう簡単ではない。

「工数を減らしたい」に対して、現場の操作、監査、承認権限、既存システム、責任、評価、部署の存在意義まで別の目的が次々に生える。

Harvard Business Reviewも2025年のAI導入論で、企業がAIから価値を出せない障壁を、技術ではなくpeople, processes, and politicsの問題として整理している。

個人では、あるべき姿を決めた後にAIへ最適化させればいい。

会社では、あるべき姿を決めるところ自体が交渉になる。

しかも全部がくだらない政治とは限らない。

説明責任や監査のために人間承認を残すのは合理的な場合がある。

一方で、単に権限が減るのが嫌だから承認を残したい場合もある。

AIから見れば、どちらも「人間承認が必要」という同じ制約に見える。

その制約が本当に必要なのかを決めるのは、最後は人間社会である。


最後に:人間が握るのは「目的」と「現実」だけでいいのかもしれない

AI時代に人間が全部考え、全部実装し、全部確認する必要はなくなってきた。

目的を決める。

AIにあるべき姿と基準を作らせる。

AIに実装させる。

AIに検査させる。

外部の証拠で照合する。

失敗したら、失敗を次回のルールに変える。

人間工数が残ったら、そこを次の改善対象にする。

このループが回るなら、人間が細かい実装を知っている必要はかなり減る。

ただし、最後まで委譲しにくいものがある。

そもそも何を達成したいのか。

その目的は現実に合っているのか。

だから最終的には、

人間:目的を決める。現実を見る。

AI:その間を全部埋める。

くらいまで役割分担が進むのかもしれない。

個人でやるとかなり快適。

会社でやると国会が開く。

やはり政治は強い。


めんどいちゃん

この記事を書いた人

めんどいちゃん

仕事や日常の「めんどい」を構造化して、次に動きやすくする記事を書いています。

このサイトについて