AI 帮你评稿的分数其实是假的 —— 我用五篇真稿跑了一百四十次
你把刚写完的一章贴进 AI,问它:「这章几分?」
它回你 7.5 分,还附上三行理由,听起来头头是道。你松一口气,关掉视窗。
隔天你想再确认一次,同一段字、同一个问题,这次它给 8 分。你改了一句话,变 7 分。你什么都没改、只是换个问法,又变 8.5 分。
那个分数到底在衡量什么?
我们在做 AI 试读报告的时候被这个问题卡了很久,所以我们去量了 —— 用五篇真实稿件、约一百四十次模型呼叫,把「AI 给稿子打分数」这件事拆开来看。结论不太舒服,但很明确:那个分数不能用。 不是它不够准,是它根本没有在区分东西。
这篇把量到的东西摊开讲,包括我们最后怎么绕过它。
实验长什么样子
- 素材:五篇真实稿件(不是为了测试而生成的范例,是真的有人在写的东西),题材与成熟度刻意拉开
- 规模:约 140 次模型呼叫,横跨四个 prompt 版本
- 另一组:同一章一字未改,用同一批读者跑两次,逐格比对 15 个段落 × 5 位读者 = 75 格评级
下面每一条发现都来自这两组。
发现一:同一个评分者,对五篇完全不同的稿子,给同一个分数
第一版做法很直觉:给模型一个读者人格,请它读完之后打 1-10 分。
结果批判型的那位读者,对五篇题材、篇幅、成熟度都差很远的稿件,全部给 4 分。标准差 0.00。
一致性完美,区分力是零。
这里有个很容易上当的地方:如果你只看「重跑会不会给一样的分数」,这个版本表现满分。它非常稳定 —— 稳定地什么都没说。
判准:看一个 AI 评分栏位的时候,先问「它在这批样本上出现过几种值」。只出现一种值,这个栏位已经死了,不管它多稳。
发现二:只要在人格里写一句话,就能逼出满分
更麻烦的是第二个发现。
当「扮演读者」和「打分数」是同一个步骤时,分数会跟着人格走。我们试著在人格描述里加一句「我不会给低分」——
它就真的不给低分了。同一篇稿子,10/10。
这不是模型坏掉,是我们把评分权交到了人格手上。而人格是使用者可以写的东西。任何让使用者自订 AI 评审的产品,只要没有处理这一层,那个分数就是使用者自己写给自己的。
发现三:想让它更稳,最省力的做法是让它不再区分任何东西
发现一之后,我们去调 prompt,把「叙事声音」的判准写得更严谨,想提高重跑一致性。
结果:五篇稿件 × 三次重跑 = 15 次,全部判「中」。
一致性数字漂亮了,因为它再也不会判「高」或「低」了。
这是评分类 prompt 最常见的自我欺骗:你以为在提高质量,其实是在把刻度削平,而且过程中每一步的指标都在变好。
发现四:四个版本排出四种名次,而我无法说哪个对
我们一共做了四个 prompt 版本。同样五篇稿件,四个版本排出四种不同的名次 —— 其中一篇在前三版都是最后一名,第四版变成第一名。
哪一版是对的?
我没有办法回答。因为从头到尾没有一把人的尺 —— 没有人先把这五篇排出名次当基准。少了那个基准,「新版比较准」是一句不可验证的话。四个版本的重跑一致性都在改善,但我是在没有回馈的情况下乱走。
如果你要调评分类的 AI:先让真人把样本排出名次,再拿那个名次去评各个版本。先立尺,再调。
那什么是可信的?重跑实测
分数不能用,不代表整件事没有价值。我们把同一章一字未改跑两次,逐格比对,想知道哪些东西重跑会活下来:
| 看什么 | 两次跑的结果 | 判定 |
|---|---|---|
| 段落切法 | 完全一致 | 稳 |
| 投入曲线形状 | 相关系数 0.89 | 稳 |
| 逐格评级 | 75 格中 55 格相同(73%) | 大致稳 |
| 每段平均值 | 平均漂移 0.20,最大 0.60 | 小数点不可信 |
| 最低的那几段 | 最低 2 段完全重叠、最低 4 段完全重叠 | 稳 |
| 读者之间的分歧度 | 最分歧的 4 段只重叠 1 段 | 杂讯 |
两个要点:
一、能用的是排名,不是绝对值。 「最低的两段」两次都指同一对;但如果你设一个固定门槛(例如低于某个分数算问题段),某一段会在门槛两侧跳来跳去,一次进榜一次不进。任何落在固定 cut-off 附近的数字都是掷骰子。
二、听起来最有洞见的指标,往往是杂讯。 「哪一段读者反应最分歧」听起来是最有价值的发现 —— 它也是唯一一个重跑不出来的。原因不神秘:五个样本撑得住平均,撑不住变异数。
所以,你可以怎么用 AI 看稿
如果你手上只有一个通用 AI,这几件事今天就能改:
- 不要问「几分」,问行为。 把「这章几分」换成「你读到哪一句的时候最想继续看下去」「你在哪里开始想跳过」。行为可以拿回稿子上核对,分数不行。
- 要它引用原文。 没有引文的评论无法查证,也无法拿来改稿。要求它把每个判断贴上你自己的句子。
- 比较的时候用排名,不要用分数。 「改完之后进步了 0.3 分」是假的;「上次五个人有三个在同一段想要更多,这次只剩一个」才是真的。
- 同一篇跑两次,只采信两次都出现的结论。 这是最便宜的杂讯过滤器,你自己就能做。
- 不要让你捏的角色兼任评审。 如果你请 AI 扮演「我的忠实读者」,就不要在同一个对话里问它分数。
我们最后怎么做
LitMemo 的 AI 试读报告 是照这些结论长出来的,不是照原本的计划:
- 不出 1-10 分。 质量只显示带状(高/中/低),因为我们没有黄金标准可以支撑小数点。
- 评分跟人格拆开。 稿件质量由一个完全看不到读者人格的环节判定,一份报告只算一次、所有读者共用。实测四个对抗性人格(包括直接写「我不会给低分」的那个,以及一个尝试指令注入的),拿到的质量栏位跟系统读者完全相同。
- 报告第一行是「几个人想看下去」,不是分数;后面接的是每个人在哪一句停下来、原文是哪一段。
- 选点用排名,不用固定门槛。 讲「最低的两段」,不讲「低于某分的段落」。
分数比较好看,也比较好卖。但一个查不了的数字,只会让你在错的地方改稿。
延伸阅读:找不到人帮你看稿的时候,可以怎么办
LitMemo