5秒结论
AI越强,人类的价值就越不只在于“什么都亲手做”。
更重要的能力,是看到成品后尽快察觉“哪里不对”“太无聊”“我根本不想点”,再把这种感觉转成原因、目标和约束,让AI去寻找方案、完成实现,最后由人重新看真实成品并判断。
循环变成:
发现违和感 → 对话诊断 → 0到1策划 → 实现 → 看真实结果 → 再发现违和感。
表面上看,这像一个只会抱怨的老板。
但只要人没有把像素和代码都规定死,这就不是传统的微观管理。它更像是人握住目标函数和质量标准,把搜索与执行委托给AI。
1. 一切从“整理得很整齐,但真的很无聊”开始
想象一个首页:分类清楚,文章数量也列得很整齐。
没坏。也能解释设计逻辑。
但第一反应仍然是:
“这也太无聊了。”
这种不满很麻烦,因为它不是传统故障。测试能过,规格也可能全部满足,可就是不想点。
和对话式AI反复讨论后,模糊的不爽会逐渐变成具体问题。
运营者展示的是库存:“这里98篇,那里78篇。”
第一次来的读者想的却是:
“现在有没有我感兴趣的?” “我有这个问题,该点哪里?” “我没什么明确目的,就想随便看看能不能发现点东西。”
把整个问题交给强大的0到1策划AI后,答案可能不再是“把分类做漂亮一点”,而是“让读者从自己的状态和需求进入”。
这不是修CSS。
这是重新定义首页的用途。
2. 人类的工作开始看起来像“难搞客户”
当AI连实现都能做,人类说的话会越来越奇怪。
“这里看着很廉价。” “技术上没错,但我不想点。” “功能有了,体验却死了。” “能不能更有意思一点?”
单独看这些话,像噩梦客户。
真正的微观管理却是另一回事:
“间距必须12像素。” “必须三列。” “这句话必须放这个位置。”
那会在探索前就锁死答案。
更好的分工是:人负责评价——好不好、符不符合目的、哪里让人不舒服。
怎么修,则给策划AI和实现AI更大的空间。
所以所谓“难搞客户”,其实是在同时做产品负责人、总编辑、创意总监和质量保证。
键盘变安静了,职位反而更重了。
3. 违和感是高价值传感器,但它本身不是规格书
“我讨厌这个”可能非常有价值。
但直接丢给实现AI也很危险。
这可能只是个人口味,也可能是别的改动带来的副作用。听话的AI完全可以认真执行一个坏抱怨,然后把整个产品一起搞坏。
所以要先把反应转成可验证的结构:
- 症状:什么触发了违和感
- 原因候选:为什么会不舒服
- 读者:谁会受到影响
- 理想状态:应该能做到什么
- 约束:什么绝对不能被破坏
- 完成标准:看到什么证据才算更好
“首页很无聊”可以变成:
“页面把运营者的分类放得太前,第一次来的读者难以从自己的需求和心情探索。我们需要的是需求导向入口,而不是库存展示。”
这时,抱怨就变成了设计输入。
4. 对话把个人口味变成可证伪的假设
关键不是崇拜违和感。
“我不喜欢”和“用户会受损”不是一回事。
所以要用研究、设计原则、反例和真实使用数据去攻击自己的抱怨。
问题真的是信息太多吗?
还是分类围绕运营者而不是读者?
没有明确目标的人是不是缺少入口?
老用户反而会不会更喜欢密集列表?
这一层能保留人的直觉,同时防止个人审美变成产品法律。
违和感是传感器。
对话是诊断。
实现是治疗。
传感器响一次,不要立刻冲进手术室。
5. “像逛大卖场一样,顺手发现本来没打算找的东西”并不算模糊
“做得更有趣一点”搜索空间太大。
但如果说“像在大型商店里逛着逛着,突然发现本来没准备买的东西”,目标体验就清楚很多。
意外发现, 探索, 移动, 好奇, 以及超出原目标的有用信息。
重点不是复制别人的颜色、卡片或布局。
而是把品牌例子提高一个抽象层级,提取成“让目的外发现自然发生”。
具体例子应该约束方向,而不是锁死解法。
这样AI仍然有设计空间。
6. 把0到1策划和实现分开,会更强
已知故障不需要每次召开战略大会。
找原因,修,测试即可。
但“让首页从根本上变得有趣”接近0到1工作。在实现前,让强策划系统集中做一次方案探索很有价值。
对话AI负责拆解不满和定义需求。
0到1策划AI负责探索结构和替代方案。
实现AI负责代码、测试和回归。
人负责目的、约束、优先级和最终采纳。
不需要无限生产计划文档。
策划只有接上实现才有价值。
7. 研究也没有说“人类+AI就一定最强”
2024年Nature Human Behaviour的一项元分析汇总了106项实验、370个效应量,这些实验直接比较了人类单独、AI单独和人机组合。[1]
平均来看,人机组合优于人类单独。
但与“人类或AI中表现更好的那个”相比,人机组合平均更差。
最后再加一个人,并不会自动变强。
该研究还发现,决策任务中的人机协作更容易出现损失,而创作任务相对更有希望。
因此真正的问题不是“要不要用AI”。
而是:
谁负责哪一部分?
任务分解本身就是性能变量。
8. AI的能力边界是锯齿状的
2026年Organization Science发表的一项758名知识工作者实验测试了真实感很强的咨询任务。[2]
在AI能力边界内的18项任务中,使用AI的人平均多完成12.2%的任务,速度快25.1%,质量也更高。
但在一个专门放在能力边界外的复杂管理任务中,使用AI的人得出正确答案的概率低了19%。
在人看来同样像“脑力活”的两件事,对AI而言可能一件很强、一件很差。
这就是锯齿状技术边界。
因此实践上可以让AI负责大规模探索、草稿、综合、实现和机械检查。
人保留意图、重大取舍、系统一致性和“这看起来不对”的判断。
不是因为人天然更聪明,而是因为任务边界真的重要。
9. 人从“写初稿的人”转向“编辑的人”,也符合其他生产率研究
2023年Science对453名专业人士的实验发现,在写作任务中使用生成式AI后,平均完成时间减少40%,评分质量提高18%。[3]
2025年Quarterly Journal of Economics基于5,172名客服人员的数据也发现,AI辅助使每小时解决问题数平均提高15%,经验较少的人收益更大。[4]
这些研究当然没有证明“老板只要说哪里不爽,公司就会自己运转”。
它们支持的是一个更温和的结论:
当草稿、重复处理和候选方案生成变便宜后,人类更容易把时间移到“做什么”“留什么”“哪里不对”。
亲手做的能力不会消失。
只是它不再是唯一瓶颈。
10. 最大陷阱:每条抱怨都修,最后掉进局部最优
修卡片。
修广告。
修推荐。
修搜索。
每个部件都变好。
整个产品却更乱。
完全可能发生。
所以抱怨驱动的改进还需要另一个全局审查层。
谁会来?
来做什么?
第一步应该是什么?
接下来应该发现什么?
最后应该带走什么?
有没有某些功能其实应该删除?
局部优化和系统方向是两种工作。
还有一个原因需要外部检查:人也会被AI带着走。实验表明,人机反馈循环可能改变并放大人的判断偏差。[5]
“AI也同意我”不是证据。
要回到研究、真实行为、反例和循环之外的现实。
11. “你看着办,弄好点”只有在共享上下文足够多之后才成立
没有上下文时,“弄好点”就是抽奖。
但如果目标、反目标、约束、参考体验和验收证据都已经共享,这句话就会变成快捷指令。
例如:
症状:首页整齐,但没有生命力。
原因:运营者视角的分类占据中心。
目标:读者可以从自己的需求和心情进入。
参考:逛大店时意外发现东西。
不要做:像素级复制其他网站。
完成:新读者能从需求入口找到内容,真实行为数据也显示发现和继续浏览改善。
这不是盲目甩锅。
而是把很长的共享上下文压缩成一句话。
强团队里的“按老办法来”本来就是这么工作的。
现在AI也逐渐能吃得下这种压缩指令了。
12. 实现AI挂了,开发组织也不应该一起脑死亡
假设实现应用在重要工作窗口前突然崩溃。
如果思考和执行绑在一起,一切都会停。
更好的结构是把思考队列和执行队列分开。
编码代理不可用时,仍然可以:
收集违和感, 诊断, 查资料, 排序, 定义约束, 写验收标准。
恢复后,实现AI不需要重新花昂贵时间理解问题。
它直接消费准备好的任务。
这当然能省成本。
更重要的是提高韧性。
一个供应商故障,不应该变成整个组织的大脑停机。
13. AI时代的老板不需要知道所有答案
你不必亲自写所有代码。
不必第一次就画出完美界面。
也不必在搜索开始前就知道正确解法。
但你需要握住这些东西:
“这不对。”
“原因是这个。”
“谁应该得到什么更好的结果。”
“这些东西不能被破坏。”
“这个结果可以上线。”
AI可以生成大量方案、实现它们,也能做很多检查。
但如果连“什么叫好”也彻底外包,系统就失去了优化目标。
人类的工作并不是简单消失。
它被压缩到了更上游。
新的管理句式会变成:
“不是这个。原因在这里。方向在那边。用最好的办法做到。”
“你看着办,弄好点”正在慢慢变成一种真正的技术。
参考资料
[1] Vaccaro, M., Almaatouq, A., & Malone, T. (2024). When combinations of humans and AI are useful: A systematic review and meta-analysis. Nature Human Behaviour, 8, 2293–2303. https://doi.org/10.1038/s41562-024-02024-1
[2] Dell’Acqua, F., et al. (2026). Navigating the Jagged Technological Frontier: Field Experimental Evidence of the Effects of Artificial Intelligence on Knowledge Worker Productivity and Quality. Organization Science, 37(2), 403–423. https://doi.org/10.1287/orsc.2025.21838
[3] Noy, S., & Zhang, W. (2023). Experimental evidence on the productivity effects of generative artificial intelligence. Science, 381(6654), 187–192. https://doi.org/10.1126/science.adh2586
[4] Brynjolfsson, E., Li, D., & Raymond, L. (2025). Generative AI at Work. The Quarterly Journal of Economics, 140(2), 889–942. https://doi.org/10.1093/qje/qjae044
[5] Glickman, M., & Sharot, T. (2025). How human–AI feedback loops alter human perceptual, emotional and social judgements. Nature Human Behaviour, 9, 345–359. https://doi.org/10.1038/s41562-024-02077-2
