先说结论
最近回头看自己的 AI 用法,我发现一件挺奇怪的事。
我几乎不会把步骤一条一条写死给 AI。
我平时说的,大概就是:“我想赢”“把我的工作量降下来”“别半路停”“确认一下到底做没做完”。
很粗。真的很粗。
但只要认真去满足这种粗粒度目标,AI 就会被迫把条件拆开、定义完成标准、设计验证方法,并在失败过的地方继续加护栏。
结果,流程慢慢从“人每次都亲自检查”变成了:让 AI 做,让 AI 查,再拿外部证据核对,只把异常报告给人。
查了一圈后才发现,这和 OpenAI 在 2026 年公开的 “Harness Engineering” 很接近。这里可以把它理解成:为 AI 智能体设计运行环境、约束、工具和反馈回路,让它能在边界内自主完成工作。
人负责意图和边界,AI 智能体负责执行。
不过,这种方法在个人项目里很强,一进公司就会突然变难。
个人项目是没有政治的独裁国家。
一搬进公司,议会立刻开会。
起点只有两个:想赢,想少干活
上层目标简单得离谱。
打卡牌游戏时,我想赢。
做文章流程或自动化时,我想减少自己要做的事。
这两个目标非常强。
做模拟器、跑大量对局、加搜索算法都可以。
但最后只剩一句:“所以胜率提高了吗?”
做文章自动处理、多语言、质量检查、队列、哈希、重试也都可以。
但最后还是一句:“所以我的活少了吗?”
技术可以越来越复杂,目的却不需要一起变复杂。
因为目的很稳,具体手段就可以很大胆地交给 AI。
不把每一步写死。需要时让 AI 连“应该是什么样”都一起推出来
人没必要每次都从零开始设计完成条件。
比如只给一个目标:
“把最新文章在人不介入的情况下,以正确状态一路送到正式发布。”
然后可以让 AI 自己往下拆:
- “最新”到底按什么判断
- “正确”到底是什么意思
- 翻译是否对应当前原文
- 本来要处理 50 条,只成功 1 条就结束,算不算完成
- 只提交到 GitHub 能不能叫“已发布”
- 是否还要检查真实网站
也就是说,人主要握住的是目标和不可违反的条件,更细的验收标准可以让 AI 展开。
当然,AI 生成的标准自己也会错。
所以接下来还需要验证。
我大量使用 AI,但“AI 说做完了”不算证据
从外面看,很像把一切都甩给 AI。
其实也差不多:执行扔给 AI,检查也扔给 AI。
本人最好连日志都不要看。
理想状态是:
执行 → 自动检查 → 正常就简短报告 → 异常才带着原因和修复方案回来。
重点是,不能把 AI 的自我申报直接当成完成条件。
不是一句“做完了”就结束,而是去拿可从外部观察的东西:处理数量、测试结果、哈希、GitHub 上的真实文件、真实网址、线上页面内容等。
如果只是让同一个 AI 在同一段上下文里“检查一下自己刚才做的事”,它很可能把同一个误解重复两遍。
所以更强的结构会把生成、检查、外部证据拆开。
人不需要把所有内容都亲自读一遍。
但也不能只接受一句“已经确认”。
说得粗暴一点就是:
“我不看。你去查。但证据拿回来。”
每一个卡点,都是“这里还残留着人工工时”
如果真的想把工作量压下去,中间那些小小的手动作业都会变得刺眼。
每次都得在这里点一下。
这个例外只能靠人判断。
失败了以后还得人去看日志。
发布之后还得人手动确认。
普通做法很容易变成:“算了,这一点手工就手工吧。”
但如果目标本来就是“减少我的工作”,那它就是未完成项。
只要发现某一步必须靠人努力才能成立,就说明那一步的设计还没结束。
这样一来,错误就不只是事故。
如果系统本该跑 50 条,却跑 1 条就正常退出,不是把剩下 49 条补跑完就结束。
要问的是:“为什么跑 1 条也能被判成正常完成?”
如果旧翻译被当成最新版,也不是只改那一篇。
要把规则改到:“旧翻译以后为什么不能再被判成正常?”
失败不断升级为规则,人类的工作就会一点点消失。
会说“我不懂”的上司还算好。更可怕的是把现实改掉的评审
2026 年 8 月,Zenn 上有一篇文章《AI 让我们的生产力变成 3 倍,也让我们把团队落在了后面》,写到 AI 使用加速以后,上司已经无法充分评审成员产出的情况。
里面有一句很有代表性的话,大意是:“我暂时还不能完全理解,但我觉得你说的是对的。”
作为评审,这当然不强。
但管理上还有一种更危险的情况。
明明不懂,却为了维持上位者的位置,在事后改写事实和标准。
事前没有标准,看到结果以后再说“正常人当然会这么做”。
你去咨询,他说“自己想”;你自己推进,他又说“谁让你擅自做的”。
到了这一步,大家就不是在向正确答案靠近了,因为“正确答案”本身会移动。
反过来,如果一个人能承认“这个我现在评不了”,就还有补救空间:加专业评审、把检查项自动化、强制输出依据和未确认事项。
能力不足可以补。
会移动的判定标准,会直接把质量保证系统本身拆掉。
现在回头看,我大概知道自己为什么讨厌“仪式化质量改善”了
质量控制,也就是常说的 QC,小组活动本来的目标,是让一线小组持续改善质量和工作方式。
日本科学技术联盟对 QC 小组的说明,也是第一线员工持续进行管理和改善活动。
问题不是质量控制本身。
问题出在“真正改善”让位给“把质量改善做出来的样子做完整”的时候。
先弄一个主题。
做几张图。
套进一套固定的 QC 改善步骤。
做发表资料。
评审。
鼓掌。
结束。
这就不是持续改善,而是“持续改善角色扮演大赛”。
相比之下,现在用 AI 跑的循环反而朴素得多。
失败。
找原因。
找复现条件。
改退出条件和检查规则。
再跑。
确认同一种失败以后不能再伪装成“正常完成”。
没有漂亮发表会。
但下一轮确实少一点人工工时。
讽刺的是,这反而更接近质量控制最初那种“持续改善”的味道。
回过神来,已经和 OpenAI 的 Harness Engineering 很像了
OpenAI 在 2026 年 2 月公开了 “Harness Engineering”,介绍以 Codex 为中心、由 AI 智能体主导的开发方式。
文章里提到,他们给内部产品设置了“人工手写代码 0 行”的约束,并估算整个构建速度大约是传统手写方式的 10 倍。
真正重要的并不只是快。
更关键的是:人的主要工作从写代码,转向设计环境、表达意图、建立反馈回路。
OpenAI 还强调,边界、正确性、可复现性这类关键约束应该集中强制执行;在这些边界内,则给 AI 智能体很大的自主空间。
这和这里的做法非常像。
“怎么实现”不用每一步都管。
但“这些东西绝对不能破”要明确。
一旦失败,就把失败变成下一轮的文档、测试、静态检查或工具规则。
本人也许只是单纯觉得“细节太麻烦,我不想看”,最后却自然变成了给 AI 智能体搭一套能自己跑下去的脚手架。
不是先学了思想再实践。
是因为懒,从另一条山路爬到了同一座山顶。
这点还挺好笑。
个人项目是零政治的独裁国家。公司里则会开议会
个人项目里,这种方法特别强。
所有者是自己。
用户是自己。
评审者也是自己。
成功的定义者还是自己。
“想在卡牌游戏里赢”,就看胜率有没有上去。
“想少干活”,就看人工介入有没有减少。
目标函数只有一条,所以无论 AI 在中间搞出多复杂的系统,最后都可以拉回两个非常简单的问题:
所以更能赢了吗?
所以我的活少了吗?
个人项目就是一个没有政治的独裁国家。
而且独裁者还很懒,于是 AI 官僚体系疯狂自动化。
公司就不一样了。
你说“减少工时”,马上会长出一串别的目标:现场操作习惯、审计、审批权、既有系统、责任、绩效、部门存在感。
Harvard Business Review 在 2025 年讨论企业 AI 落地时,也把主要障碍概括成人员、流程和组织政治,而不是单纯的技术问题。
个人项目里,确定目标状态之后,让 AI 优化就行。
公司里,连“目标状态应该是什么”本身都要谈判。
而且不是所有政治都毫无意义。
为了审计和问责保留人工审批,可能非常合理。
但也可能只是因为有人不想失去审批权。
对 AI 来说,这两种情况最后都只是同一个约束:“需要人工批准”。
这个约束到底该不该存在,最后仍然是人类社会的问题。
最后:也许人真正需要握住的,只剩“目的”和“现实”
AI 时代,人不一定还要亲自设计所有步骤、完成所有实现、再亲自检查全部结果。
确定目的。
让 AI 生成目标状态和标准。
让 AI 实现。
让 AI 检查。
拿外部证据核对。
失败了,就把失败变成下一轮规则。
还有人工工时,就把那里列为下一项改进对象。
如果这个循环能稳定跑起来,人对每个实现细节的了解需求会明显下降。
但仍有两个问题很难完全外包:
我们到底想实现什么?
这个目的和现实真的一致吗?
所以最终的角色分工,也许会越来越像这样:
人:决定目的,观察现实。
AI:填满中间的一切。
个人项目里,非常舒服。
放进公司,议会开会。
政治依然很强。
