AI 帮你评稿的分数其实是假的 —— 我用五篇真稿跑了一百四十次

你把刚写完的一章贴进 AI,问它:「这章几分?」

它回你 7.5 分,还附上三行理由,听起来头头是道。你松一口气,关掉视窗。

隔天你想再确认一次,同一段字、同一个问题,这次它给 8 分。你改了一句话,变 7 分。你什么都没改、只是换个问法,又变 8.5 分。

那个分数到底在衡量什么?

我们在做 AI 试读报告的时候被这个问题卡了很久,所以我们去量了 —— 用五篇真实稿件、约一百四十次模型呼叫,把「AI 给稿子打分数」这件事拆开来看。结论不太舒服,但很明确:那个分数不能用。 不是它不够准,是它根本没有在区分东西。

这篇把量到的东西摊开讲,包括我们最后怎么绕过它。

实验长什么样子

  • 素材:五篇真实稿件(不是为了测试而生成的范例,是真的有人在写的东西),题材与成熟度刻意拉开
  • 规模:约 140 次模型呼叫,横跨四个 prompt 版本
  • 另一组:同一章一字未改,用同一批读者跑两次,逐格比对 15 个段落 × 5 位读者 = 75 格评级

下面每一条发现都来自这两组。

发现一:同一个评分者,对五篇完全不同的稿子,给同一个分数

第一版做法很直觉:给模型一个读者人格,请它读完之后打 1-10 分。

结果批判型的那位读者,对五篇题材、篇幅、成熟度都差很远的稿件,全部给 4 分。标准差 0.00。

一致性完美,区分力是零。

这里有个很容易上当的地方:如果你只看「重跑会不会给一样的分数」,这个版本表现满分。它非常稳定 —— 稳定地什么都没说。

判准:看一个 AI 评分栏位的时候,先问「它在这批样本上出现过几种值」。只出现一种值,这个栏位已经死了,不管它多稳。

发现二:只要在人格里写一句话,就能逼出满分

更麻烦的是第二个发现。

当「扮演读者」和「打分数」是同一个步骤时,分数会跟着人格走。我们试著在人格描述里加一句「我不会给低分」——

它就真的不给低分了。同一篇稿子,10/10。

这不是模型坏掉,是我们把评分权交到了人格手上。而人格是使用者可以写的东西。任何让使用者自订 AI 评审的产品,只要没有处理这一层,那个分数就是使用者自己写给自己的。

发现三:想让它更稳,最省力的做法是让它不再区分任何东西

发现一之后,我们去调 prompt,把「叙事声音」的判准写得更严谨,想提高重跑一致性。

结果:五篇稿件 × 三次重跑 = 15 次,全部判「中」

一致性数字漂亮了,因为它再也不会判「高」或「低」了。

这是评分类 prompt 最常见的自我欺骗:你以为在提高质量,其实是在把刻度削平,而且过程中每一步的指标都在变好。

发现四:四个版本排出四种名次,而我无法说哪个对

我们一共做了四个 prompt 版本。同样五篇稿件,四个版本排出四种不同的名次 —— 其中一篇在前三版都是最后一名,第四版变成第一名。

哪一版是对的?

我没有办法回答。因为从头到尾没有一把人的尺 —— 没有人先把这五篇排出名次当基准。少了那个基准,「新版比较准」是一句不可验证的话。四个版本的重跑一致性都在改善,但我是在没有回馈的情况下乱走。

如果你要调评分类的 AI:先让真人把样本排出名次,再拿那个名次去评各个版本。先立尺,再调。

那什么是可信的?重跑实测

分数不能用,不代表整件事没有价值。我们把同一章一字未改跑两次,逐格比对,想知道哪些东西重跑会活下来

看什么 两次跑的结果 判定
段落切法 完全一致
投入曲线形状 相关系数 0.89
逐格评级 75 格中 55 格相同(73%) 大致稳
每段平均值 平均漂移 0.20,最大 0.60 小数点不可信
最低的那几段 最低 2 段完全重叠、最低 4 段完全重叠
读者之间的分歧度 最分歧的 4 段只重叠 1 段 杂讯

两个要点:

一、能用的是排名,不是绝对值。 「最低的两段」两次都指同一对;但如果你设一个固定门槛(例如低于某个分数算问题段),某一段会在门槛两侧跳来跳去,一次进榜一次不进。任何落在固定 cut-off 附近的数字都是掷骰子。

二、听起来最有洞见的指标,往往是杂讯。 「哪一段读者反应最分歧」听起来是最有价值的发现 —— 它也是唯一一个重跑不出来的。原因不神秘:五个样本撑得住平均,撑不住变异数。

所以,你可以怎么用 AI 看稿

如果你手上只有一个通用 AI,这几件事今天就能改:

  1. 不要问「几分」,问行为。 把「这章几分」换成「你读到哪一句的时候最想继续看下去」「你在哪里开始想跳过」。行为可以拿回稿子上核对,分数不行。
  2. 要它引用原文。 没有引文的评论无法查证,也无法拿来改稿。要求它把每个判断贴上你自己的句子。
  3. 比较的时候用排名,不要用分数。 「改完之后进步了 0.3 分」是假的;「上次五个人有三个在同一段想要更多,这次只剩一个」才是真的。
  4. 同一篇跑两次,只采信两次都出现的结论。 这是最便宜的杂讯过滤器,你自己就能做。
  5. 不要让你捏的角色兼任评审。 如果你请 AI 扮演「我的忠实读者」,就不要在同一个对话里问它分数。

我们最后怎么做

LitMemo 的 AI 试读报告 是照这些结论长出来的,不是照原本的计划:

  • 不出 1-10 分。 质量只显示带状(高/中/低),因为我们没有黄金标准可以支撑小数点。
  • 评分跟人格拆开。 稿件质量由一个完全看不到读者人格的环节判定,一份报告只算一次、所有读者共用。实测四个对抗性人格(包括直接写「我不会给低分」的那个,以及一个尝试指令注入的),拿到的质量栏位跟系统读者完全相同。
  • 报告第一行是「几个人想看下去」,不是分数;后面接的是每个人在哪一句停下来、原文是哪一段。
  • 选点用排名,不用固定门槛。 讲「最低的两段」,不讲「低于某分的段落」。

分数比较好看,也比较好卖。但一个查不了的数字,只会让你在错的地方改稿。

延伸阅读:找不到人帮你看稿的时候,可以怎么办

常见问题

所以 AI 完全不能用来评估稿子吗?
可以用,但要换问题。分数这一类「把质量压成一个数字」的输出不可信;行为类的问题(你在哪一句想停下来、哪一段最想继续看、你记得哪个角色的名字)可信得多,因为答案可以拿回稿子上核对。要求它每个判断都引用你自己的原文,没有引文的评论一律当成没说。
为什么同一篇稿子重跑,分数会变?
有两层原因。一是生成式模型本身有抽样随机性,同样输入不保证同样输出;二是更根本的问题——没有黄金标准。我们实测四个 prompt 版本对同五篇稿件排出四种不同名次,却无法判断哪一种对,因为从头到尾没有一份真人排序当基准。我们也量到每段平均值在两次跑之间漂移 0.20 到 0.60,所以小数点没有意义。
AI 说我的稿子「很有潜力」,这句话能信吗?
没有引文的评价都无法查证,好话坏话都一样。而且我们实测过,只要在人格描述里写「我不会给低分」,同一篇稿子就能拿到 10/10——AI 的称赞有多容易被诱导出来,可能比你想的低。要判断一句评论有没有资讯量,问它「这是根据哪一段?」,答不出具体段落的就丢掉。
我可以自己做这个实验吗?
可以,而且最便宜的版本五分钟就能做完:把同一篇稿子、同一个问题,在两个干净的对话里各问一次,比对两次的结论。只采信两次都出现的那些。想再进一步,就拿两篇你自己心里有高下之分的稿子去问同一个问题——如果 AI 给的分数分不出你已经知道的差距,那个分数对你就没有用。