AI 编辑写文章前会查哪些资料?

AI 编辑看的地方,大致分成下面 8 层。

阅读功能说明

收听会朗读正文;速读会按顺序显示短语,速度可调。语言练习可对照已有的不同语言版本。收藏保存在本浏览器中,可从播放器的收藏列表再次打开。

分享这篇文章

分享这篇文章

广告
广告

这篇文章按照当前的文章质量 v5 标准,整理了 AI 编辑在创作、修改、检查文章时"看哪里""先看什么""怎样既有依据又有梗"。
文中不含任何能识别个人的信息。具体的私生活、工作单位、住址、账号信息等都已做泛化处理。

5 秒结论:写文章要看 8 层

AI 编辑看的地方,大致分成下面 8 层。

  1. 这次的需求 —— 要做什么,不做什么
  2. 过往记忆与过往会话 —— 文风、质量规则、以前定下的例外
  3. GitHub 上最新的 main —— 目前有效的约定、质量 epoch(标准周期)、编辑规则、QA
  4. 原文与原始资料 —— 数字、日期、引用、专有名词、不确定性,这些是"绝对不能弄坏的地基"
  5. 网络上的一手、官方、研究资料 —— 时效性、制度、规格、研究、反证
  6. 文章本身 —— 读者需求、切入角度、结构、论点与依据、梗、自然度
  7. 12 种语言版本 —— 本地化的是概念而不是字面,准确的名称要原样保留
  8. 真实网站、真实数据、QA 证据 —— 手机、放大、长文、链接、表格,连出错时的样子都要确认

也就是说,不是"读一遍谷歌的指南然后写文章"。
只盯着谷歌,会被谷歌员工的幽灵附身;只盯着微软,说明书会开始自己生说明书。文章工厂需要的,是把多个强有力的资料和这篇文章的目的连起来的编辑判断。


1. 最先看的是"这次的订单"

最优先的是这次用户的指示。

"要全面""要简短""多来点梗""基于研究""不要图片""12 种语言""去掉个人信息",这些都是只在这一次有效的条件。旧模板再漂亮,订单要的是拉面,你端上咖喱,那就是事故。

这里主要定下面 5 件事。

  • 这篇文章写给谁
  • 读者的疑问是什么
  • 读完之后,要让读者明白什么、能做什么
  • 需要查到什么程度
  • 只在这一次适用的禁忌、格式和语气是什么

这一步要先定下文章的"Reader Need(读者需求)"和"Reader Outcome(读完后的收获)"。


2. 接着看过往记忆与过往会话

一篇文章,光靠当下的指示是不够的,还需要不断积累下来的编辑规则。

比如按现在的标准,有这些规则:

  • 对普通成年人读起来自然,初中生也能跟上意思
  • 5 秒看到结论,30 秒了解概要
  • 光看标题就知道是什么文章
  • 只读 H2(二级标题)也能看出脉络
  • 原则上一段只讲一件事
  • 结论→理由→具体例子
  • 专业术语先讲"它到底是什么",再讲名字
  • 梗是用来帮助读者理解论点的
  • 能识别个人的信息要泛化
  • 12 种语言不逐字翻译

这里重要的是,不要把过往记忆当作事实的出处。

"以前是这么定的"可以用在制作方针上。但如果价格、法律、规格、研究结果、现行制度都用"以前就是这么说的"来蒙混,文章就成了时间胶囊。

记忆用来保持编辑方针的连贯,事实要回到当前的证据上去。


3. GitHub 上最新的 main 是"现行说明书"

长期运营中,GitHub 上最新的 main 是文章工厂的正本(唯一权威版本)。

现行的质量体系没有再增加第 29 条质量轴,而是把专业编辑的门道,作为子关卡整合到现有的 28 条母轴之下。

AI 会看的代表性正本有下面这些。

  • 当前的质量 epoch
  • 28 条质量轴
  • 读者体验与认知无障碍
  • 内容质量
  • 微软 / 谷歌的扩展标准
  • 专业编辑工作流
  • 日语编辑规则
  • 自然的文风
  • 多语言与本地化标准
  • 信息护照与时效
  • PASS / SAMPLE_PASS / COMPLETE_100 的定义
  • 正式采用、发布、验证的约定

这里要紧的是,最新的规则高于旧的成功记录。

昨天拿了 100 分的文章,质量规则一变,也只是"昨天的 100 分",成了历史。就像按旧规则全胜的选手,不能拿着"我昨天赢了,所以今天也是冠军"去参加新赛季的比赛。


4. 原文与原始资料是"绝对不能弄坏的地基"

编辑能动的是文章的呈现方式,而不是把事实改成对自己方便的样子。

特别要保护的有下面这些。

  • 数字
  • 日期
  • 金额
  • 单位
  • 人数
  • 制度名称
  • 产品规格
  • URL
  • 引用
  • 出处
  • 专有名词
  • 研究设计
  • 不确定性
  • "不知道"这种状态

为了读起来顺口,把"约 30%"改成"差不多一半",那就不是更好读,而是换了一条世界线。

AI 编辑的基本功,是在不改变意思的前提下,调整顺序、解释、例子、标题和措辞。


5. 上网要先看"最硬的依据"

需要时效性或外部事实的文章,就要上网查。但也不是搜索结果从上往下挨个磕头。

信息源大致按下面的强度来看。

  1. 标准、法律、一手资料
  2. 官方提供方的指南与规格
  3. 一手研究、同行评审的研究
  4. 专业的编辑与新闻报道准则
  5. 可靠的二手资料
  6. 社区、社交媒体、个人经历

当然,这会随文章类型而变。
如果问题是"用户实际感觉怎么样",Reddit 和社交媒体也可能有分量。反过来,如果问题是"WCAG(网页无障碍标准)的硬性要求是什么",却拿论坛里一句"应该是 24px 吧"来拍板,标准会哭的。

另外,对于分析、比较、研究、推荐和影响大的文章,还要去找能推翻自己结论的资料。

"我找了 5 份支持这个说法的资料!"这不叫研究,叫粉丝团。


6. 28 条质量轴不是"28 位神仙"

现行体系保留 28 条母轴。大体上分为 17 条读者体验轴和 11 条内容质量轴。

读者体验的 17 条轴

  1. 注意力
  2. 记忆
  3. 判断
  4. 处理速度
  5. 理解
  6. 信息线索(告诉读者想找的内容在哪里的提示)
  7. 视觉杂乱
  8. 层级
  9. 版面
  10. 文字
  11. 颜色与视觉
  12. 操作
  13. 多语言
  14. 辅助技术
  15. 动效
  16. 状态变化
  17. 对真实数据的耐受

内容质量的 11 条轴

  1. 读者、目的、读完后的收获
  2. 独特价值
  3. 可信度、作者、制作方式
  4. 风险、数字、决策
  5. 表格、图、图片的含义
  6. 步骤、行动、记忆负担
  7. 包容性与文化
  8. 读者任务能否完成
  9. 各地区的完成度
  10. 性能与专注阅读
  11. 作为声音的文字(念出来是否顺耳)

28 条不需要每次都像念经一样在正文里全念一遍。

目的不是"把轴填满",而是先想好读者会在哪里绊倒,再用和那道障碍相关的轴。

要是文章工厂里开始有人说"今天向 28 位神仙的供奉还差 3 条轴",那就不是质量管理了,是宗教法人。


7. 看专业编辑的 14 个子关卡

28 条母轴之下,还有 14 个属于专业编辑流程的子关卡。

  1. 读者需求与读完后的收获
  2. 文章的切入角度
  3. 开头的钩子
  4. 这篇文章讲什么,为什么重要
  5. 把重要信息放前面
  6. 每个段落的作用
  7. 论点与依据的对应
  8. 反证检查
  9. 信息源的强度
  10. 按"结构→事实→文字"的顺序编辑
  11. 在正文里兑现标题的承诺
  12. 让读者能预测下一步会有什么的导览
  13. 写法与术语的一致
  14. 发布后的时效与内容负债

不过,并不是把它们机械地套到每篇文章上。

美食体验类的文章,没必要整套披上路透社的新闻结构;API 规格书,也不必以"突然,面条笑了。"开头。

**只用适合这类文章的技法。**这才是关键。


8. 编辑顺序是"结构→事实→文字"

专业编辑里,顺序这件事看着不起眼,其实很管用。

第 1 遍:结构

  • 有没有回答读者的疑问
  • 有没有切入角度
  • 结论是不是太晚
  • 只看 H2 能不能走通整个脉络
  • 有没有重复的章节
  • 有没有多余的章节

第 2 遍:事实与依据

  • 论点有没有依据
  • 依据是不是真的支撑这个论点
  • 数字的样本总量、比较对象需不需要交代
  • 有没有相反的证据
  • 是不是过时的信息

第 3 遍:文字

  • 单句是不是塞得太满
  • 专业术语有没有解释
  • "这个""那个"这类指代有没有迷路
  • 梗有没有起作用
  • 有没有变成 AI 味的装饰性加粗,或连环"※补充"

把这个顺序倒过来,就成了给下周要拆的房子把墙纸换得光鲜亮丽的编辑。


9. 数值规则分成 3 种

一出现数字,AI 有时就会突然想自己定一个"基准值"。这时要踩刹车。

数值一定要分成 3 种。

官方、标准规定的数值

例如:WCAG 中相当于 320 CSS px 的重排(内容随屏幕宽度重新排布)、200% 文字放大、目标尺寸等。

这些在该标准规定的范围和例外之内,可以作为 hard gate(必须通过的硬性关卡)。

研究得出的数值

研究对象、语言、条件、样本不同,就不能原样当作万能标准。

不能因为研究里有"英语 ○ 个词",就用计算器炼金炼出"日语 ○ 个字"。

站内的经验法则

比如"H2 有 4 个以上就检查一下要不要目录"。

它们方便用来找出需要复查的候选,但不能让经验法则升职当警察。

谷歌自己也没有给出过"谷歌喜欢的字数"这类万能数值。该看的不是长度,而是有没有把目的所需的内容讲到位。


10. 12 种语言不是翻译,而是本地化

支持的语言是:

  • 日语
  • 英语
  • 韩语
  • 中文(简体)
  • 中文(繁体)
  • 西班牙语
  • 葡萄牙语(巴西)
  • 印度尼西亚语
  • 泰语
  • 越南语
  • 法语
  • 德语

多语言化时,词分成 3 类。

LOCALIZE_CONCEPT

一般概念,换成该语言里通常能理解的说法。

KEEP_EXACT_NAME

产品名、标准名、API、URL、代码、文件名、论文标识符等,准确的名称很重要的,原样保留。

KEEP_EXACT_NAME_WITH_LOCAL_DESCRIPTOR

名称保留,但光看名称不知道是什么的,用该语言加一句简短的说明。

把日语的语序、换行、谐音梗原样搬到 12 种语言里,不叫翻译。
那是出国旅行时拿着日本插头硬往插座里怼。

玩笑也要把意思本地化。传不过去的梗,就换成另一种自然的笑点。


11. PASS 不是平均分,而是关卡制

现行的基本做法是 gate-first-score-second(先过关,再打分)。

也就是说,不存在这样的事:

"事实是错的,但设计 95 分、文章 96 分,平均超过 90,合格!"

严重的 FAIL,不能用平均分抹掉。

SAMPLE_PASS

在检查过的样本中,没有发现严重问题。

PASS

当前对象的范围被准确定义,所需证据与当前的内容 identity、质量 epoch、规则版本挂上了钩,必要项目中没有尚未解决的严重 UNKNOWN。

COMPLETE_100

适用的 hard gate、语义审查,乃至所需的外部 / runtime 证据都已成立,并且在当前所有对象上都已闭环。

不会因为没有人工打分,就判为 FAIL。目前正式的语义审查主体是 source-grounded AI semantic editor(以出处为依据的 AI 语义编辑)。

但如果是 AI 自己写完,然后说:

"经 AI 老师严格审查,AI 老师的文章被判定为完全正确。"

这是不能算证据的。

法官可以是 AI,但证物不能由法官自己用黏土捏出来。


12. 看完正文,再看真实画面

正文就算是对的,画面上一旦崩了,也没法读。

在真实网站上,至少要确认下面这类状态。

  • 320px 级手机
  • 390px 级手机
  • 横屏手机
  • 平板
  • 1280px / 1440px 级电脑
  • 200% 文字放大
  • WCAG Text Spacing(拉大字距、行距后版面仍不崩的标准)
  • 伪本地化(模拟翻译后文字变长的测试)造成的文字膨胀
  • forced-colors(强制高对比度显示模式)
  • reduced-motion(减少动画的设置)

此外还要用真实数据里的"地雷"。

  • 最长的标题
  • 最长的、不能换行的字符串
  • 最长的正文
  • 最短的正文
  • 标题最多的文章
  • 链接最多的文章
  • 表格最多的文章
  • 类似定义列表的元素最多的文章
  • code / pre 最多的文章
  • 混用多种文字系统的文章

只拿普通文章测一测就说"没问题!",检查范围的差距,堪比在图书馆里做几个深蹲就算做完了体检。

出错、0 条结果、加载失败、翻译缺失等状态,也是文章体验的一部分。


13. 研究规则也会自己运转

质量规则本身也会过时。

所以我们把研究更新嵌进了现有的中央审计里。

  • 常规 refresh:原则上每 7 天
  • deep sweep:原则上每 30 天
  • 重大的官方变更:必要时提前

关注的对象包括 W3C/WCAG、ISO 24495、微软、谷歌、路透社、美联社、GOV.UK、认知科学、HCI(人机交互)、阅读研究、信息检索、无障碍、多语言与编辑研究等。

对于新发现,要依次确认:

是否与现有规则重复 → 信息源够不够强 → 适用于哪些文章 → 数值的适用范围是什么 → 有没有相反的证据

然后归入下面几类:

  • ADOPT
  • CONDITIONAL
  • TEST
  • DEFER
  • REJECT
  • SUPERSEDED

2026 年 8 月 28 日 v5 的首次 deep sweep 中,没有发现足以推翻现行 PASS 标准的变更,于是决定维持 v5。


14. 官方指南不是神谕

微软、谷歌、路透社、美联社、W3C、ISO,全都是强有力的资料,但适用范围各不相同。

比如在技术文档里,少用惯用语和幽默,有时对可译性和准确性有好处。

可是把这条规则一股脑用到美食体验或娱乐文章上,就会写出这种东西:

摄入了汉堡肉饼。产生了肉汁。满意度提升。

把感情落在合规室里的文字就此诞生。

官方指南要看的是"在什么语境下才对"。

不是"因为是官方的,所以所有文章都 ADOPT",必要时是 CONDITIONAL。


15. 就算 GitHub 挂了,也不能让文章的大脑跟着死

GitHub 取不到的时候,也不需要把文章创作和语义审查全部叫停。

作为恢复用的 baseline(基线),下面这些也在另一套系统里留一份。

  • 28 条母轴
  • AI 编辑方针
  • 专业编辑工作流
  • 信息源的强度
  • 数值标准
  • 研究更新的做法
  • PASS 判定
  • 不让工厂停转的原则

但在看不到 GitHub 的时候,下面这些不能靠想象来填。

  • current SHA(当前提交 ID)
  • 最新的 receipt(处理回执)
  • 是否已应用到 repo
  • 当前的正式进度

这些就是 UNKNOWN。

GitHub 恢复后,把 latest main + 恢复 baseline + 最新的一手、官方信息对一遍,再回到正常运营。

"谁最后写谁说了算"的 blind last-write-wins,不是编辑方针,是石头剪刀布。


16. 不做的事

这座文章工厂,至少要避开下面这些。

  • 只拿 AI 的回答当事实依据
  • 没做过人工审核,却写"专家已确认"
  • 把官方没说过的数字叫作"谷歌标准"之类
  • 只为了搜索排名,批量生成低价值文章
  • 标题唬人,正文却不回答
  • 为了好读而改动原文的数字或不确定性
  • 把所有文章都塞进同一种新闻体、技术文档体
  • 把日语的标题、语序、梗机械地复制到其他语言
  • 整篇正文用加粗去"殴打"读者
  • 让"※补充"像杂草一样疯长
  • 因为一篇文章失败,就让不相关的工厂跟着停
  • 仅凭抽样检查,就宣称"全站 100 分"

总结:AI 编辑在"写之前"和"写之后"更忙

只看写文章这一步,AI 编辑像个文字生成器。

但实际的工作是:

读需求 → 读过往规则 → 读 GitHub 正本 → 守住原始资料 → 查一手、官方、研究资料 → 反证 → 搭结构 → 验证事实 → 打磨文字 → 本地化成 12 种语言 → 在真实画面上找茬 → 用 QA 收尾 → 连规则本身也定期研究

一直到这里。

"帮我写篇文章"只是开始按钮,不是工作说明。

文章工厂的 AI 编辑,一个人兼着作者、校对、研究员、翻译编辑、QA 和设备维护在巡检。

而最重要的,不是写出遵守规则的文字,而是写出让读者能立刻抓住意思、能顺着追到依据、能做出所需判断的文章。

规则是为此而用的工具。这座文章工厂,不是用来供奉工具箱的。

今天读这篇

每一篇都回答读完本文后常有的下一个问题。

浏览全部文章更多「AI」文章

分享这篇文章

广告

再来一篇?有没有好玩的?

读完顺便看看:几篇相近的,还有几篇完全不同但很有意思的。

  1. 相近的话题为什么总被人用随意语气说话服务场景的语言学
  2. 包上挂着飞鼠玩偶,刚从高级酒店出来人人都在擅自给别人写“设定集”
  3. 完全不同,但很有趣成为哈奇瓦雷,不要成为“硬推先生”挑结婚对象,要看关系OS和亲族治理,而不只是看本人
  4. 凌晨5点身体说“睡吧”,大脑说“本店仍在营业”
  5. AURA原来是“微风”从《葬送的芙莉莲》的断头台阿乌拉,到情趣酒店的“日常已经不在了吧”
  6. 滨松“とん唐てん”实吃记冲着超值午餐去,结果从冷味噌亲子丼聊到了干冰炸猪排

查找其他文章

接下来可以搜

所有文章

Mendoi-chan

本站运营者

Mendoi-chan

把工作与日常生活中的麻烦整理成清晰的结构和下一步行动。