一开始,只是一个很小的问题。
“Tibo到底星期几休息?”
在OpenAI负责Codex、ChatGPT相关工作的Tibo,经常发布模型上线、重置和新功能的信息。久而久之,用户这边很容易形成一种奇怪的“民间气象学”。
Tibo发帖 → 今天可能有事发生。 Tibo安静 → 他休息? → 那重置是不是也不来了?
模型还没开始跑,人已经先在推理另一个人的排班表。
接着,话题从“Tibo休不休息”一路钻进了行为心理学、多巴胺、生成式AI生产率、路线图压缩,最后抵达无限工作。
这篇文章就是事故记录。
1. “Tibo休息,重置也休息”目前仍然只是猜想
2026年9月5日,Tibo在发布Astra上线和banked reset相关信息后,对团队写下了 “See you next week for some more ships.”[2][3]
放在一周工作结束的语境里,这很自然地像一句“本周收工,下周继续”。
但公开信息最多只能支持一个温和结论:团队似乎进入了周末模式。
我们无法据此确认:
- Tibo本人正式休息日是哪天;
- 每一次重置是否都需要Tibo亲手操作;
- Tibo不发帖时,重置流程是否也停止。
所以虽然很想画出:
Tibo不在 → 重置操作员不在 → 文明终结
这样一条漂亮因果链,但目前这张图漂亮得有点过头。
“下周见”可以证明有人准备收工。不能证明Tibo一个人守着一颗巨大的红色RESET按钮。
2. 可人还是会不停地看:“到了吗?”
真正有意思的是用户侧。
重置什么时候来可能并不确定。有时会公告,有时banked reset突然到账。一旦额度回来,强模型马上又能开工。
于是检查循环启动:
看X。没有。 看额度。没有。 几小时后再看。没有。 再看一次。回来了。过年。
如果每天上午9点整固定重置,9点01分看一次就完事。
可一旦时间不可预测,脑子里就会住进一个小巡逻员:
“现在会不会来了?”
本文郑重把它命名为Tibo抽卡。
3. 与其说是巴甫洛夫的狗,不如说更像“变动时距强化”
很容易想到“这不就是巴甫洛夫的狗吗?”其实并不完全一样。
经典条件作用讨论的是一个刺激逐渐能够预告另一个刺激,并引发学习到的反应。这里真正的问题却是:为什么反复检查这个行为会持续?
更接近的是操作性条件作用里的部分强化,也叫间歇强化。尤其是变动时距强化(variable-interval schedule):强化会在不可预测的时间间隔之后出现。[6]
OpenStax心理学教材给出的典型例子几乎精准命中:查看社交媒体。[6]
很像。
但必须补一句:你看X十次,并不会让重置概率提高十倍。重置是外部事件,查看只是发现它。
因此这并不是说“OpenAI在实验室里用变动时距强化训练用户”。
更准确的说法是:从用户视角看,不规则出现的奖励环境,很容易形成类似变动时距的反复检查习惯。
4. 突然重置为什么格外爽:奖励预测误差
再往下一层,就是神经科学。
奖励预测误差(reward prediction error)简单说就是预计得到的奖励与实际得到的奖励之间的差。Wolfram Schultz的综述指出,许多中脑多巴胺神经元在奖励好于预期时表现出正预测误差,完全符合预期时接近基线,而差于预期时出现负预测误差。[7]
于是:
“今天大概不会来了。”
↓
突然重置。
↓
比预期好。
这种事件作为学习信号会非常显眼。
但直接跳到“你这是多巴胺成瘾”就太粗糙了。
奖励预测误差是基本学习机制,不是给查看重置额度的人诊断成瘾的工具。如果所有行为都用“多巴胺爽了一下”解释,神经科学很快就会退化成酒桌理论。
稳妥的说法是:不可预测的好消息,比完全按时出现的好消息带来更大的预测惊讶。
5. 然后人类得出结论:“把Tibo的无限电脑给我”
盯额度盯烦了以后,人类会提出一个非常理性的解决方案:
“直接让我用Tibo的电脑。无限量。”
下面这台终端100%虚构:
C:\Users\Tibo> codex
Usage remaining: ∞%
banked reset: yes
rate limit: employee privilege
Astra: unrestricted
GPU: 公司的
产品名:Codex Pro Tibo Edition。
规则也很简单:
每周上限:直到Tibo生气。
现实当然没这么慈善。OpenAI Help Center说明,Astra会消耗相应套餐里的Work/Codex额度,而且根据任务、输入输出长度、推理设置等因素,Astra可能比GPT-5.6 Sol更快消耗额度。[5]
于是两句话可以同时为真:
“这么强,我想多用。” “越强,表可能越快融化。”
想要虚构的Tibo Edition,不需要高级心理学,算术已经够了。
6. 然后Astra把“六个月”搬了过来
这里开始真正离谱。
Tibo说,在Astra尚未广泛提供时,它可能是团队很大的竞争优势;有了Astra后生产率大幅提升,结果是部分计划被提前大约六个月,从原本次年年中左右改到DevDay发布。[1]
这已经不是“自动补全快了一点”。
OpenAI自己也把Astra描述为面向复杂端到端工作的模型,覆盖编码、研究、电脑操作和专业工作流。[4][9]
OpenAI公布的评估中,Astra在OSWorld 2.0延迟模拟里每项任务用时比GPT-5.6 Sol少约47%,同时得分更高;配合更新后的Codex harness,在Mind2Web上的任务完成速度达到1.9倍。[4]
用户的自然反应只有一句:
“实验够充分了。交出来。”
Astra听起来已经不像模型名,更像路线图拆迁队。
7. 但“提前六个月”不等于“删掉六个月的人类劳动”
这个边界必须守住。
路线图提前六个月,并不等于AI替代了整整六个月的人类工时。
开发路线里除了写代码,还有研究、原型、评审、依赖、等待、返工、测试、决策。
强AI可能通过这些方式压缩路径:
- 从研究到实现连成一个工作流;
- 更快比较多个原型;
- 并行处理人类原本要等待的准备工作;
- 更早发现返工;
- 把“下个月才验证”的东西今天就开始验证。
这样缩短的可能是整个关键路径。
Tibo的帖子没有公开哪个步骤缩短了多少天,所以不能把“六个月”直接换算成人月。
能确认的核心只有一点:按照他的描述,原本待在未来的工作被拉到了现在附近。[1]
2027年的工作:“还没叫我啊。”
Astra:“今天来。”
2027年的工作:“啊?”
8. 生产率提高,有时带来的不是休息,而是更多工作
到这里,“无限工作”就不只是段子了。
2026年,UC Berkeley Haas研究人员介绍了一项进行中的研究:他们对美国一家约200人的科技公司观察了八个月。随着生成式AI扩散,员工工作更快、承担更广的任务范围,而且工作延伸到一天中更长的时间段。[8]
值得注意的是,这家公司并没有强制使用AI。研究者认为,AI让更多任务显得“我也能做”,于是员工主动扩张了工作边界。[8]
这只是一个公司的案例,不能当成所有企业的宇宙定律。
但机制很好懂:
原本6小时的任务 → AI 40分钟搞定
人:“赚到5小时20分!”
组织:“太棒了。这里还有八件。”
人:“休息这个功能下架了吗?”
AI可以缩短任务。它不会自动生成‘节省时间必须兑换成休息’的组织权限。
9. 这就是“无限工作”的真身
生产率提升至少可以花在三个地方:
- 同样结果更快完成,增加余量;
- 同样时间提高质量;
- 同样时间增加产量。
技术决定能做多少。新增能力分配到哪里,由人和组织决定。
在成长型组织里,想法、改进、客户需求、研究问题可能几乎没有尽头。
吞吐量翻倍,不保证待办清单减半。
反而可能是:以前因为太远、太贵而不值得开始的工作,现在突然变成了新待办。
Astra上线
→ 工作做完
→ 半年后的工作靠近
→ 又做完
→ 更远的工作出现
如果这是游戏,只是视距变远了。换到公司,效果是地平线上的任务图标也全部加载出来了。
10. 结论:可能结束的不是工作,而是路线图
我们最初只是在问:“Tibo周末休息吗?”
然后一路变成:
Tibo安静
→ 没重置?
→ 反复检查
→ 像变动时距强化
→ 突然重置产生更大预测误差
→ 给我无限电脑
→ Astra强得离谱
→ 计划提前六个月
→ 未来工作填进节省的时间
→ 无限工作
最后剩下两个要点。
第一,人工盯着不规则重置真的很耗精神。既然事件发生在外部,能自动通知就别让人类终身转职成额度表保安。
第二,AI生产率不会自动兑换成休闲。如果不明确决定把收益分给休息、质量、速度还是产量,新能力就会继续召唤新任务。
Astra不是反派。强工具确实会把未来拉近。
真正危险的是旁边的人说:
“咦,这个今天也能做吧?”
然后未来的工作开始在门口排队。
工作未必会结束。路线图可能先结束。
