有人把一项不算小的软件改造交给了AI代理。
原本以为几十分钟就能结束,结果GitHub里的提交、测试、集成修改不断增加。几个小时后,真实代码还在继续变化。
与此同时,人类已经把现实世界里的其他事情做完,甚至连一次搬家都结束了。
生活事件先完成,AI还在重构。
这画面已经很像未来。
更离谱的是,发出指令的终端只是一部手机。用户不需要亲自精通每个TypeScript模块、CI/CD细节或图学习规则。只要用自然语言给出目标、不能破坏的规则、允许的修改、禁止的修改以及完成条件,代理就能读取仓库、设计、写代码、补测试、开PR并继续集成。
那么,这算不算“拿着手机就变成高级工程师”?
不完全是。但它确实比过去的软件开发常识更接近这个方向。
1. 真正在做高级计算的不是手机
手机本身并没有在本地生成几百行生产代码。它是指挥台。
背后连接的是AI模型、GitHub、CI、云、生产环境、搜索和开发工具。手机只是把人的意图和约束传过去。
所以更准确的说法不是“用手机写软件”,而是:
“用手机编排远程的认知与计算资源。”
数据中心没有缩进裤兜。
只是裤兜里多了一个能控制数据中心和AI代理的遥控器。
2. 为什么这种工作接近高级工程师难度
难度不能只看代码行数。
这类改造需要理解现有架构、避免重复实现、保护生产路径、理解调度器/GitHub/CI/发布之间的边界、把新决策逻辑接入已有中央循环、保护隐私、不把缺失数据误认为0、补测试、区分代码失败与CI基础设施失败,以及判断“哪些地方绝对不要动”。
这不是简单完成一个小工单,而是管理一个正在运行系统中的变更爆炸半径。
如果换成人类,通常更接近高级后端工程师或Platform Engineer。若还承担全系统架构责任,其中一部分判断会接近Staff Engineer。
难点不只是“能写复杂代码”。
难的是知道复杂代码放在哪里才不会制造事故。
3. 实际改动有多大
某个匿名实现案例的主要PR包含:
- 11个文件变更;
- 13次提交;
- 约895行新增;
- 自动发芽判断runtime;
- Article DNA保护;
- 行为学习;
- 对内部链接优化的受限反馈;
- 测试;
- 专用CI定义。
合并之后工作还没结束。后来又加入gate,避免行为学习在生产验证前自行改写链接图;缺失的telemetry也继续保持UNKNOWN,而不是偷偷当成0。
因此,这不是“895行代码的工作”。
而是先理解系统,再写895行,然后再给这895行加笼子,防止它们乱跑的工作。
代码行数从来不是可靠的难度单位。100行可以删掉数据库,1万行也可以只是一个非常热情的计算器。
4. 如果是人类,要几天
如果让一个优秀但第一次接触该仓库的工程师承担同样的责任范围,粗略估计5~15人日并不夸张。
其中包括读代码和运维规则、设计、实现、测试、诊断CI与基础设施问题、处理评审,以及检查生产影响。
真正敲代码可能更快。
但在生产系统里,证明自己没弄坏东西,有时比写代码本身更贵。
日本IPA在没有另行规定时,将1人月换算为160人时,也就是8小时×20个工作日。
因此5~15人日约等于0.25~0.75人月。
5. 如果雇人来做,大概要多少钱
这没有统一定价。合同方式、责任范围、是否熟悉系统、评审与生产保证都会影响价格。
不过公开市场价格能帮助判断数量级。
Levtech公布的数据称,按每周5天全职方式委托自由职业IT顾问,基于2025年7月数据,参考费用约为每月100万~110万日元。
按20个工作日简单换算,每天约5万~5.5万日元。对应5~15人日,单纯人工成本约为25万~82.5万日元。
真实外包还可能加上项目管理、评审、返工风险、保证、管理费用和利润,因此更高也很正常。
所以把这种工作理解为“几千日元的小活”不太现实。
当然,也不能反过来说“AI赚了80万日元”。AI的速度、并行能力、失败方式、监督成本和工具成本都与人不同。
更准确的说法是:
过去可能要消耗高技能工程师数天甚至数周的工作,如今一个人可以从很小的终端上把它启动起来。
6. AI跑6小时,就等于高级工程师工作6小时吗
不等于。
AI不会休息,不会被拉去开会,不会被聊天软件打断,也不会盯着天花板想“这个架构到底是谁批准的”。它还能高速切换工具。
但它也可能在错误前提上高速前进,误判生产状态,把CI基础设施故障当成代码故障,扩大权限,或者混淆“写了测试”和“测试实际通过”。
所以不能只按钟表计算价值。
应该看最终变更、证据、验证和生产回读的质量。
“跑了6小时还没停,挺能坚持”可以。
“跑了6小时,所以6小时都正确”不行。
7. 自己不会写代码的人,价值会下降吗
更像是角色在改变。
过去,一个人有想法后,常常要先学Git、编程语言、框架、部署和测试,才能把想法变成软件。
AI代理大幅降低了这种实现摩擦。
于是人的高价值工作会更集中到:做什么、为什么做、什么绝对不能破坏、允许自动改到哪里、什么叫成功、什么必须保持UNKNOWN、单点失败应该全停还是局部隔离。
“能亲自写每一行代码”正在不再是唯一入场券。
但这并不意味着完全不需要技术理解。即使不能亲自写每个模块,越理解目标、风险、依赖和验证,给AI的指令就越好。
不会制造发动机也能开车。
但不能连红灯是什么意思都不知道。
8. 为什么“交给AI就好了”很危险
最可怕的失败不是报错页面。
而是带着成功的表情做错事。
PR可能已经合并但没有上线;CI文件可能存在但runner从未真正开始任何step;数据拿不到却被当成0;新逻辑与旧逻辑同时运行造成双重执行;“为了安全”把自动化整个停掉;或者“为了自主”把权限悄悄放大。
好的自动化不是只会继续前进。
而是在前进的同时,仍然区分事实与未验证状态。
9. 怎么从手机上更安全地委托
与其背所有框架名,不如遵守几个顺序。
先定义最终结果
不要只说“改这个文件”,而要说“完成后什么必须为真”。
写出不变量
明确现有功能、隐私、图片规则、发布路径、SEO等不能被破坏的东西。
明确权限
能否覆盖、能否开PR、能否合并、能否改生产环境,都写清楚。
先读取当前状态
优先current main、真实runtime和真实public state,而不是旧聊天记录。
把验证也算作交付物
“写完代码”不等于完成。测试、CI、生产回读可能都要纳入完成条件。
允许UNKNOWN存在
不要把不知道的东西强行塞进PASS或FAIL。
手机屏幕很小。
规格的责任并不会因此变小。
10. 结论:坏掉的也许不是手机,而是过去的门槛
一个自己不能独立写高级生产代码的人,如今可以在手机上让AI代理持续数小时工作,并把包含高级工程判断的改动整合进GitHub。
几年前,这句话会很奇怪。
现在只要条件合适,它可以真实发生。
这并不代表工程师不再需要。
更合理的理解是:工程价值的一部分正在从手工实现移动到架构、约束、验证与责任边界。
AI没有消灭价值。
它改变了价值所在的位置。
最大的变化也许是,那些过去会停在“技术上我做不到”的人,现在可以从更前一步开始参与:
“那我们到底应该做什么?”
手机仍然只是一块玻璃板。
但这块玻璃板已经能成为调用高级工程资源的遥控器。
这确实有点像世界坏掉了。
只不过坏得挺有意思。
- Levtech,IT顾问委托费用指南,2026-08-18更新。基于2025年7月数据,自由职业IT顾问全职参考价约100万~110万日元/月。https://levtech.jp/partner/guide/article/detail/390/
- IPA,软件开发数据白皮书FAQ。说明在无其他定义时,1人月=160人时(8小时×20天)。https://www.ipa.go.jp/archive/publish/wp-sd/qa.html

