这篇文章按照当前的文章质量 v5 标准,整理了 AI 编辑在创作、修改、检查文章时"看哪里""先看什么""怎样既有依据又有梗"。
文中不含任何能识别个人的信息。具体的私生活、工作单位、住址、账号信息等都已做泛化处理。
5 秒结论:写文章要看 8 层
AI 编辑看的地方,大致分成下面 8 层。
- 这次的需求 —— 要做什么,不做什么
- 过往记忆与过往会话 —— 文风、质量规则、以前定下的例外
- GitHub 上最新的 main —— 目前有效的约定、质量 epoch(标准周期)、编辑规则、QA
- 原文与原始资料 —— 数字、日期、引用、专有名词、不确定性,这些是"绝对不能弄坏的地基"
- 网络上的一手、官方、研究资料 —— 时效性、制度、规格、研究、反证
- 文章本身 —— 读者需求、切入角度、结构、论点与依据、梗、自然度
- 12 种语言版本 —— 本地化的是概念而不是字面,准确的名称要原样保留
- 真实网站、真实数据、QA 证据 —— 手机、放大、长文、链接、表格,连出错时的样子都要确认
也就是说,不是"读一遍谷歌的指南然后写文章"。
只盯着谷歌,会被谷歌员工的幽灵附身;只盯着微软,说明书会开始自己生说明书。文章工厂需要的,是把多个强有力的资料和这篇文章的目的连起来的编辑判断。
1. 最先看的是"这次的订单"
最优先的是这次用户的指示。
"要全面""要简短""多来点梗""基于研究""不要图片""12 种语言""去掉个人信息",这些都是只在这一次有效的条件。旧模板再漂亮,订单要的是拉面,你端上咖喱,那就是事故。
这里主要定下面 5 件事。
- 这篇文章写给谁
- 读者的疑问是什么
- 读完之后,要让读者明白什么、能做什么
- 需要查到什么程度
- 只在这一次适用的禁忌、格式和语气是什么
这一步要先定下文章的"Reader Need(读者需求)"和"Reader Outcome(读完后的收获)"。
2. 接着看过往记忆与过往会话
一篇文章,光靠当下的指示是不够的,还需要不断积累下来的编辑规则。
比如按现在的标准,有这些规则:
- 对普通成年人读起来自然,初中生也能跟上意思
- 5 秒看到结论,30 秒了解概要
- 光看标题就知道是什么文章
- 只读 H2(二级标题)也能看出脉络
- 原则上一段只讲一件事
- 结论→理由→具体例子
- 专业术语先讲"它到底是什么",再讲名字
- 梗是用来帮助读者理解论点的
- 能识别个人的信息要泛化
- 12 种语言不逐字翻译
这里重要的是,不要把过往记忆当作事实的出处。
"以前是这么定的"可以用在制作方针上。但如果价格、法律、规格、研究结果、现行制度都用"以前就是这么说的"来蒙混,文章就成了时间胶囊。
记忆用来保持编辑方针的连贯,事实要回到当前的证据上去。
3. GitHub 上最新的 main 是"现行说明书"
长期运营中,GitHub 上最新的 main 是文章工厂的正本(唯一权威版本)。
现行的质量体系没有再增加第 29 条质量轴,而是把专业编辑的门道,作为子关卡整合到现有的 28 条母轴之下。
AI 会看的代表性正本有下面这些。
- 当前的质量 epoch
- 28 条质量轴
- 读者体验与认知无障碍
- 内容质量
- 微软 / 谷歌的扩展标准
- 专业编辑工作流
- 日语编辑规则
- 自然的文风
- 多语言与本地化标准
- 信息护照与时效
- PASS / SAMPLE_PASS / COMPLETE_100 的定义
- 正式采用、发布、验证的约定
这里要紧的是,最新的规则高于旧的成功记录。
昨天拿了 100 分的文章,质量规则一变,也只是"昨天的 100 分",成了历史。就像按旧规则全胜的选手,不能拿着"我昨天赢了,所以今天也是冠军"去参加新赛季的比赛。
4. 原文与原始资料是"绝对不能弄坏的地基"
编辑能动的是文章的呈现方式,而不是把事实改成对自己方便的样子。
特别要保护的有下面这些。
- 数字
- 日期
- 金额
- 单位
- 人数
- 制度名称
- 产品规格
- URL
- 引用
- 出处
- 专有名词
- 研究设计
- 不确定性
- "不知道"这种状态
为了读起来顺口,把"约 30%"改成"差不多一半",那就不是更好读,而是换了一条世界线。
AI 编辑的基本功,是在不改变意思的前提下,调整顺序、解释、例子、标题和措辞。
5. 上网要先看"最硬的依据"
需要时效性或外部事实的文章,就要上网查。但也不是搜索结果从上往下挨个磕头。
信息源大致按下面的强度来看。
- 标准、法律、一手资料
- 官方提供方的指南与规格
- 一手研究、同行评审的研究
- 专业的编辑与新闻报道准则
- 可靠的二手资料
- 社区、社交媒体、个人经历
当然,这会随文章类型而变。
如果问题是"用户实际感觉怎么样",Reddit 和社交媒体也可能有分量。反过来,如果问题是"WCAG(网页无障碍标准)的硬性要求是什么",却拿论坛里一句"应该是 24px 吧"来拍板,标准会哭的。
另外,对于分析、比较、研究、推荐和影响大的文章,还要去找能推翻自己结论的资料。
"我找了 5 份支持这个说法的资料!"这不叫研究,叫粉丝团。
6. 28 条质量轴不是"28 位神仙"
现行体系保留 28 条母轴。大体上分为 17 条读者体验轴和 11 条内容质量轴。
读者体验的 17 条轴
- 注意力
- 记忆
- 判断
- 处理速度
- 理解
- 信息线索(告诉读者想找的内容在哪里的提示)
- 视觉杂乱
- 层级
- 版面
- 文字
- 颜色与视觉
- 操作
- 多语言
- 辅助技术
- 动效
- 状态变化
- 对真实数据的耐受
内容质量的 11 条轴
- 读者、目的、读完后的收获
- 独特价值
- 可信度、作者、制作方式
- 风险、数字、决策
- 表格、图、图片的含义
- 步骤、行动、记忆负担
- 包容性与文化
- 读者任务能否完成
- 各地区的完成度
- 性能与专注阅读
- 作为声音的文字(念出来是否顺耳)
28 条不需要每次都像念经一样在正文里全念一遍。
目的不是"把轴填满",而是先想好读者会在哪里绊倒,再用和那道障碍相关的轴。
要是文章工厂里开始有人说"今天向 28 位神仙的供奉还差 3 条轴",那就不是质量管理了,是宗教法人。
7. 看专业编辑的 14 个子关卡
28 条母轴之下,还有 14 个属于专业编辑流程的子关卡。
- 读者需求与读完后的收获
- 文章的切入角度
- 开头的钩子
- 这篇文章讲什么,为什么重要
- 把重要信息放前面
- 每个段落的作用
- 论点与依据的对应
- 反证检查
- 信息源的强度
- 按"结构→事实→文字"的顺序编辑
- 在正文里兑现标题的承诺
- 让读者能预测下一步会有什么的导览
- 写法与术语的一致
- 发布后的时效与内容负债
不过,并不是把它们机械地套到每篇文章上。
美食体验类的文章,没必要整套披上路透社的新闻结构;API 规格书,也不必以"突然,面条笑了。"开头。
**只用适合这类文章的技法。**这才是关键。
8. 编辑顺序是"结构→事实→文字"
专业编辑里,顺序这件事看着不起眼,其实很管用。
第 1 遍:结构
- 有没有回答读者的疑问
- 有没有切入角度
- 结论是不是太晚
- 只看 H2 能不能走通整个脉络
- 有没有重复的章节
- 有没有多余的章节
第 2 遍:事实与依据
- 论点有没有依据
- 依据是不是真的支撑这个论点
- 数字的样本总量、比较对象需不需要交代
- 有没有相反的证据
- 是不是过时的信息
第 3 遍:文字
- 单句是不是塞得太满
- 专业术语有没有解释
- "这个""那个"这类指代有没有迷路
- 梗有没有起作用
- 有没有变成 AI 味的装饰性加粗,或连环"※补充"
把这个顺序倒过来,就成了给下周要拆的房子把墙纸换得光鲜亮丽的编辑。
9. 数值规则分成 3 种
一出现数字,AI 有时就会突然想自己定一个"基准值"。这时要踩刹车。
数值一定要分成 3 种。
官方、标准规定的数值
例如:WCAG 中相当于 320 CSS px 的重排(内容随屏幕宽度重新排布)、200% 文字放大、目标尺寸等。
这些在该标准规定的范围和例外之内,可以作为 hard gate(必须通过的硬性关卡)。
研究得出的数值
研究对象、语言、条件、样本不同,就不能原样当作万能标准。
不能因为研究里有"英语 ○ 个词",就用计算器炼金炼出"日语 ○ 个字"。
站内的经验法则
比如"H2 有 4 个以上就检查一下要不要目录"。
它们方便用来找出需要复查的候选,但不能让经验法则升职当警察。
谷歌自己也没有给出过"谷歌喜欢的字数"这类万能数值。该看的不是长度,而是有没有把目的所需的内容讲到位。
10. 12 种语言不是翻译,而是本地化
支持的语言是:
- 日语
- 英语
- 韩语
- 中文(简体)
- 中文(繁体)
- 西班牙语
- 葡萄牙语(巴西)
- 印度尼西亚语
- 泰语
- 越南语
- 法语
- 德语
多语言化时,词分成 3 类。
LOCALIZE_CONCEPT
一般概念,换成该语言里通常能理解的说法。
KEEP_EXACT_NAME
产品名、标准名、API、URL、代码、文件名、论文标识符等,准确的名称很重要的,原样保留。
KEEP_EXACT_NAME_WITH_LOCAL_DESCRIPTOR
名称保留,但光看名称不知道是什么的,用该语言加一句简短的说明。
把日语的语序、换行、谐音梗原样搬到 12 种语言里,不叫翻译。
那是出国旅行时拿着日本插头硬往插座里怼。
玩笑也要把意思本地化。传不过去的梗,就换成另一种自然的笑点。
11. PASS 不是平均分,而是关卡制
现行的基本做法是 gate-first-score-second(先过关,再打分)。
也就是说,不存在这样的事:
"事实是错的,但设计 95 分、文章 96 分,平均超过 90,合格!"
严重的 FAIL,不能用平均分抹掉。
SAMPLE_PASS
在检查过的样本中,没有发现严重问题。
PASS
当前对象的范围被准确定义,所需证据与当前的内容 identity、质量 epoch、规则版本挂上了钩,必要项目中没有尚未解决的严重 UNKNOWN。
COMPLETE_100
适用的 hard gate、语义审查,乃至所需的外部 / runtime 证据都已成立,并且在当前所有对象上都已闭环。
不会因为没有人工打分,就判为 FAIL。目前正式的语义审查主体是 source-grounded AI semantic editor(以出处为依据的 AI 语义编辑)。
但如果是 AI 自己写完,然后说:
"经 AI 老师严格审查,AI 老师的文章被判定为完全正确。"
这是不能算证据的。
法官可以是 AI,但证物不能由法官自己用黏土捏出来。
12. 看完正文,再看真实画面
正文就算是对的,画面上一旦崩了,也没法读。
在真实网站上,至少要确认下面这类状态。
- 320px 级手机
- 390px 级手机
- 横屏手机
- 平板
- 1280px / 1440px 级电脑
- 200% 文字放大
- WCAG Text Spacing(拉大字距、行距后版面仍不崩的标准)
- 伪本地化(模拟翻译后文字变长的测试)造成的文字膨胀
- forced-colors(强制高对比度显示模式)
- reduced-motion(减少动画的设置)
此外还要用真实数据里的"地雷"。
- 最长的标题
- 最长的、不能换行的字符串
- 最长的正文
- 最短的正文
- 标题最多的文章
- 链接最多的文章
- 表格最多的文章
- 类似定义列表的元素最多的文章
- code / pre 最多的文章
- 混用多种文字系统的文章
只拿普通文章测一测就说"没问题!",检查范围的差距,堪比在图书馆里做几个深蹲就算做完了体检。
出错、0 条结果、加载失败、翻译缺失等状态,也是文章体验的一部分。
13. 研究规则也会自己运转
质量规则本身也会过时。
所以我们把研究更新嵌进了现有的中央审计里。
- 常规 refresh:原则上每 7 天
- deep sweep:原则上每 30 天
- 重大的官方变更:必要时提前
关注的对象包括 W3C/WCAG、ISO 24495、微软、谷歌、路透社、美联社、GOV.UK、认知科学、HCI(人机交互)、阅读研究、信息检索、无障碍、多语言与编辑研究等。
对于新发现,要依次确认:
是否与现有规则重复 → 信息源够不够强 → 适用于哪些文章 → 数值的适用范围是什么 → 有没有相反的证据
然后归入下面几类:
- ADOPT
- CONDITIONAL
- TEST
- DEFER
- REJECT
- SUPERSEDED
2026 年 8 月 28 日 v5 的首次 deep sweep 中,没有发现足以推翻现行 PASS 标准的变更,于是决定维持 v5。
14. 官方指南不是神谕
微软、谷歌、路透社、美联社、W3C、ISO,全都是强有力的资料,但适用范围各不相同。
比如在技术文档里,少用惯用语和幽默,有时对可译性和准确性有好处。
可是把这条规则一股脑用到美食体验或娱乐文章上,就会写出这种东西:
摄入了汉堡肉饼。产生了肉汁。满意度提升。
把感情落在合规室里的文字就此诞生。
官方指南要看的是"在什么语境下才对"。
不是"因为是官方的,所以所有文章都 ADOPT",必要时是 CONDITIONAL。
15. 就算 GitHub 挂了,也不能让文章的大脑跟着死
GitHub 取不到的时候,也不需要把文章创作和语义审查全部叫停。
作为恢复用的 baseline(基线),下面这些也在另一套系统里留一份。
- 28 条母轴
- AI 编辑方针
- 专业编辑工作流
- 信息源的强度
- 数值标准
- 研究更新的做法
- PASS 判定
- 不让工厂停转的原则
但在看不到 GitHub 的时候,下面这些不能靠想象来填。
- current SHA(当前提交 ID)
- 最新的 receipt(处理回执)
- 是否已应用到 repo
- 当前的正式进度
这些就是 UNKNOWN。
GitHub 恢复后,把 latest main + 恢复 baseline + 最新的一手、官方信息对一遍,再回到正常运营。
"谁最后写谁说了算"的 blind last-write-wins,不是编辑方针,是石头剪刀布。
16. 不做的事
这座文章工厂,至少要避开下面这些。
- 只拿 AI 的回答当事实依据
- 没做过人工审核,却写"专家已确认"
- 把官方没说过的数字叫作"谷歌标准"之类
- 只为了搜索排名,批量生成低价值文章
- 标题唬人,正文却不回答
- 为了好读而改动原文的数字或不确定性
- 把所有文章都塞进同一种新闻体、技术文档体
- 把日语的标题、语序、梗机械地复制到其他语言
- 整篇正文用加粗去"殴打"读者
- 让"※补充"像杂草一样疯长
- 因为一篇文章失败,就让不相关的工厂跟着停
- 仅凭抽样检查,就宣称"全站 100 分"
总结:AI 编辑在"写之前"和"写之后"更忙
只看写文章这一步,AI 编辑像个文字生成器。
但实际的工作是:
读需求 → 读过往规则 → 读 GitHub 正本 → 守住原始资料 → 查一手、官方、研究资料 → 反证 → 搭结构 → 验证事实 → 打磨文字 → 本地化成 12 种语言 → 在真实画面上找茬 → 用 QA 收尾 → 连规则本身也定期研究
一直到这里。
"帮我写篇文章"只是开始按钮,不是工作说明。
文章工厂的 AI 编辑,一个人兼着作者、校对、研究员、翻译编辑、QA 和设备维护在巡检。
而最重要的,不是写出遵守规则的文字,而是写出让读者能立刻抓住意思、能顺着追到依据、能做出所需判断的文章。
规则是为此而用的工具。这座文章工厂,不是用来供奉工具箱的。
