5秒结论:AI降低的不只是“写字成本”
AI能加快写作,但更大的变化是把编辑、翻译、质量检查、内部链接、发布、线上验证、复查和监控,从“每次都要人做”变成“按规则自动流转的工序”。
新的风险也随之出现:AI改写AI,另一个AI再摘要,原始证据逐渐消失,互联网就会变成超大型传话游戏。
因此需要一份信息护照:记录信息从哪里来、何时确认、原始数据是什么、改过什么、由谁或什么系统检查。
但不要把所有技术细节堆在正文开头。最合适的是三层:人人看得懂的短卡片、需要时展开的详情、机器读取的精确数据。
真正改变的不是写作速度,而是“如何拥有整条流程”
传统流程是研究→写作→编辑→核对来源→翻译→本地化审查→内部链接→发布→发布后检查。
只让AI写初稿,只加速一个步骤。流程自动化则是先定义质量规则,再进行AI处理、机器检查、语义检查;失败就修复并重检;只有合格内容才能进入下一阶段,发布后继续监控。
软件开发中的CI可以理解为“每次改动后自动检验”,CD则是“把合格结果送到正式环境”。用于文章时,CI像质检线,CD像出货线。QA是更广的质量保证,包括让整个生产方法更不容易产生缺陷;QC更接近某个具体检查动作。
人工最贵的地方,往往在正文周围
假设1,200篇文章扩展到11种外语,就会产生13,200个“文章×语言”单位。
每个翻译只让人检查10分钟,也要2,200小时;20分钟就是4,400小时。这里还没算原文编辑、研究、链接、发布验证、返工和更新。
日本翻译联盟给出的客户发包参考价中,计算机手册的日译英约为日文原稿每字20日元。5,000字按该参考值就是英语一种语言约10万日元。实际价格会因领域、难度、数量、交期和质量要求大幅变化,不能把它简单乘11当成11种语言的报价。[1]
把容易被AI吸收的工作打包成设备
初稿、整理、初译、语言质量检查、来源和URL核对辅助、内部链接候选、发布前检查、监控和重复审计,看起来都是小工作。合起来却像一个小型内容部门。
重点不是“一个AI替掉一个人”,而是把重复工作做成流水线:下一工序读取上一工序的合格证据,按规则处理,记录状态,只把合格结果交下去。
在兴趣项目、自动化工具或模拟器里学到的“建立唯一可信数据源、记录状态、保证可重复执行”,也可以直接迁移到业务自动化。做着做着,玩具机器人旁边长出一个编辑部。剧情有点跑偏,但很实用。
睡觉时还能运行,不是魔法,而是规则先写好了
没有规则的无人AI,不是夜班工人,更像一群流浪猫开会。
可靠自动化必须先回答:什么算合格;哪些事实绝不能改;如何保护数字和引用;并发修改如何避免冲突;失败后从哪里恢复;连续失败何时隔离;发布后检查什么。
规则建立后,人从“反复做工”转向“改进设备”。人负责想法和判断,机器负责重复转换、检查和监控。
规模化之后的问题:AI slop与“复制的复制”
低价值的大量AI生成内容常被称为AI slop。问题不是“用了AI”,而是大量内容缺乏证据、缺乏新增价值,也没有回到原始信息的路径。
Google的人本内容指南建议思考内容“谁制作、如何制作、为何制作”,并指出在大量使用AI或自动化时,解释制作方法有时能帮助读者理解内容。[2]
2024年Nature的一项研究发现,如果在训练中不加区分地递归使用模型生成数据,可能出现“model collapse”,原始数据分布尾部的信息会逐渐丢失。[3] 这并不证明发布一篇AI文章就会破坏互联网。更准确的启示是:当复制继续制造复制时,不要切断通往原始来源的路。
下一层质量标准:信息护照
W3C PROV把provenance(来历/溯源信息)定义为与数据或成果产生有关的实体、活动和人员信息,可帮助判断质量、可靠性和可信度。[4]
Crossref的Crossmark让读者快速查看研究成果是否仍是当前版本,以及是否存在更正、撤回或更新。[5] C2PA则为数字资产的来源与历史建立Content Credentials等标准。[6]
普通文章可记录:首次发布日期、真正改变内容的修改日期、最后核验日期、数据基准日、第一手或官方资料、来源访问日期、数据版本、AI使用方式、审核方式、重要变更历史。
不要伪造“专家审核”。Schema.org的reviewedBy指实际检查网页准确性或完整性的人或组织。[7] 如果只有AI和自动检查,就如实写成“AI质量检查”。
全部展示反而难读:分三层
W3C面向认知可访问性的指南建议使用清楚的词、短句、短文本块、明确标题、摘要和留白。[8]
第一层:所有人都能立即看懂的短卡片
本文依据与更新信息
最后核验:2026-08-27
数据基准日:2026-08-27
主要第一手/官方资料:9项
制作方式:AI辅助 + 来源核对
独立专家审核:无
最后重要变更:初版
[查看来源、制作方法和变更记录]
第二层:按需展开的详细证据
显示某个来源支持哪些主张、来源类型、原始标题、发布日期、访问日期、DOI/URL,以及用读者语言写出的重要限制。不要为了“易读”删除身份信息,而是把难信息放到简明解释之后。
第三层:机器读取的结构化数据和内部证据
使用持久、真实的datePublished、dateModified、citation、version、准确作者信息,以及只在真实人或组织审核时填写的reviewedBy。内部可以保存内容哈希、来源哈希、规则版本和提交记录,但无需公开私人仓库名、账户或秘密信息。
一个“更新日期”不够
应区分首次发布日期、有意义的内容修改日、最后来源核验日、数据基准日、各来源访问日。
修了一个CSS,不应该让老文章看起来像“今天刚更新事实”。读者关心的是信息是否新,不是服务器今天有没有加班。
12种语言:翻译解释,不翻译来源的“身份证”
研究做了什么、结果是什么、重要限制是什么,应使用目标语言自然解释。
论文原题、作者、期刊、年份、DOI、PubMed ID、URL、数据集名称和版本则保持原始识别信息。
原则是:理解要本地化,身份要保持。
AI时代剩下的价值:能够回到证据的大规模生产
“每天100篇”会越来越普通。更难复制的能力,是100篇文章都保留证据、访问日期、制作方法、变更历史、多语言引用完整性和重新核验的路径。
AI以前,认真往往直接增加人工成本。AI以后,可以把一部分“认真”写进可重复使用的基础设施。
目标不是单纯的内容工厂,而是信息在大规模流动时仍然带着护照的工厂。
本文的信息护照
- 初版:2026-08-27
- 来源最后核验:2026-08-27
- 数据基准日:2026-08-27
- 制作方式:依据公开标准、官方文件与研究文献进行AI辅助研究、结构化、写作和12种语言本地化
- AI用途:研究辅助、摘要、结构、写作、翻译、一致性检查
- 独立人工专家审核:无
- 重要变更:2026-08-27 初版
- 来源:文末共享Source Registry [4]–[1]
资料来源
- Japan Translation Federation — 翻訳料金の目安. Reference client prices include Japanese→English computer manuals at 20 JPY per Japanese source character; actual prices vary by specialty, difficulty, volume, deadline, processing and quality jtf.jp
- Google Search Central — Creating helpful, reliable, people-first content. Google recommends considering “Who, How, and Why”; it also discusses disclosure/context for substantial automation and AI use developers.google.com
- Shumailov, I. et al. — “AI models collapse when trained on recursively generated data.” Nature 631, 755–759 (2024). Published 2024-07-24. The paper studies recursive use of model-generated data and model collapse; it is not evidence that a single AI-assisted web article by itself damages the web nature.com
- W3C — PROV-Overview: An Overview of the PROV Family of Documents. W3C Working Group Note, 2013-04-30. Provenance is described as information about entities, activities and people involved in producing data or a thing, useful for assessments of quality, reliability and trustworthiness w3.org
- Crossref — Crossmark. Crossmark gives readers quick access to the current status of scholarly content, including corrections, retractions, updates and editorial metadata crossref.org
- C2PA — C2PA Specifications 2.4. C2PA develops technical standards for certifying the source and history/provenance of media content, including Content Credentials spec.c2pa.org
- Schema.org — citation / version / reviewedBy. citation references another CreativeWork; version identifies a CreativeWork version; reviewedBy expects a Person or Organization that reviewed a WebPage for accuracy and/or completeness. https://schema.org/version https://schema.org/reviewedBy schema.org
- W3C — Making Content Usable for People with Cognitive and Learning Disabilities. W3C Working Group Note. Guidance includes clear words, short sentences, short blocks, descriptive headings, summaries and whitespace w3.org
