AI 幫你評稿的分數其實是假的 —— 我用五篇真稿跑了一百四十次

你把剛寫完的一章貼進 AI,問它:「這章幾分?」

它回你 7.5 分,還附上三行理由,聽起來頭頭是道。你鬆一口氣,關掉視窗。

隔天你想再確認一次,同一段字、同一個問題,這次它給 8 分。你改了一句話,變 7 分。你什麼都沒改、只是換個問法,又變 8.5 分。

那個分數到底在衡量什麼?

我們在做 AI 試讀報告的時候被這個問題卡了很久,所以我們去量了 —— 用五篇真實稿件、約一百四十次模型呼叫,把「AI 給稿子打分數」這件事拆開來看。結論不太舒服,但很明確:那個分數不能用。 不是它不夠準,是它根本沒有在區分東西。

這篇把量到的東西攤開講,包括我們最後怎麼繞過它。

實驗長什麼樣子

  • 素材:五篇真實稿件(不是為了測試而生成的範例,是真的有人在寫的東西),題材與成熟度刻意拉開
  • 規模:約 140 次模型呼叫,橫跨四個 prompt 版本
  • 另一組:同一章一字未改,用同一批讀者跑兩次,逐格比對 15 個段落 × 5 位讀者 = 75 格評級

下面每一條發現都來自這兩組。

發現一:同一個評分者,對五篇完全不同的稿子,給同一個分數

第一版做法很直覺:給模型一個讀者人格,請它讀完之後打 1-10 分。

結果批判型的那位讀者,對五篇題材、篇幅、成熟度都差很遠的稿件,全部給 4 分。標準差 0.00。

一致性完美,區分力是零。

這裡有個很容易上當的地方:如果你只看「重跑會不會給一樣的分數」,這個版本表現滿分。它非常穩定 —— 穩定地什麼都沒說。

判準:看一個 AI 評分欄位的時候,先問「它在這批樣本上出現過幾種值」。只出現一種值,這個欄位已經死了,不管它多穩。

發現二:只要在人格裡寫一句話,就能逼出滿分

更麻煩的是第二個發現。

當「扮演讀者」和「打分數」是同一個步驟時,分數會跟著人格走。我們試著在人格描述裡加一句「我不會給低分」——

它就真的不給低分了。同一篇稿子,10/10。

這不是模型壞掉,是我們把評分權交到了人格手上。而人格是使用者可以寫的東西。任何讓使用者自訂 AI 評審的產品,只要沒有處理這一層,那個分數就是使用者自己寫給自己的。

發現三:想讓它更穩,最省力的做法是讓它不再區分任何東西

發現一之後,我們去調 prompt,把「敘事聲音」的判準寫得更嚴謹,想提高重跑一致性。

結果:五篇稿件 × 三次重跑 = 15 次,全部判「中」

一致性數字漂亮了,因為它再也不會判「高」或「低」了。

這是評分類 prompt 最常見的自我欺騙:你以為在提高品質,其實是在把刻度削平,而且過程中每一步的指標都在變好。

發現四:四個版本排出四種名次,而我無法說哪個對

我們一共做了四個 prompt 版本。同樣五篇稿件,四個版本排出四種不同的名次 —— 其中一篇在前三版都是最後一名,第四版變成第一名。

哪一版是對的?

我沒有辦法回答。因為從頭到尾沒有一把人的尺 —— 沒有人先把這五篇排出名次當基準。少了那個基準,「新版比較準」是一句不可驗證的話。四個版本的重跑一致性都在改善,但我是在沒有回饋的情況下亂走。

如果你要調評分類的 AI:先讓真人把樣本排出名次,再拿那個名次去評各個版本。先立尺,再調。

那什麼是可信的?重跑實測

分數不能用,不代表整件事沒有價值。我們把同一章一字未改跑兩次,逐格比對,想知道哪些東西重跑會活下來

看什麼 兩次跑的結果 判定
段落切法 完全一致
投入曲線形狀 相關係數 0.89
逐格評級 75 格中 55 格相同(73%) 大致穩
每段平均值 平均漂移 0.20,最大 0.60 小數點不可信
最低的那幾段 最低 2 段完全重疊、最低 4 段完全重疊
讀者之間的分歧度 最分歧的 4 段只重疊 1 段 雜訊

兩個要點:

一、能用的是排名,不是絕對值。 「最低的兩段」兩次都指同一對;但如果你設一個固定門檻(例如低於某個分數算問題段),某一段會在門檻兩側跳來跳去,一次進榜一次不進。任何落在固定 cut-off 附近的數字都是擲骰子。

二、聽起來最有洞見的指標,往往是雜訊。 「哪一段讀者反應最分歧」聽起來是最有價值的發現 —— 它也是唯一一個重跑不出來的。原因不神秘:五個樣本撐得住平均,撐不住變異數。

所以,你可以怎麼用 AI 看稿

如果你手上只有一個通用 AI,這幾件事今天就能改:

  1. 不要問「幾分」,問行為。 把「這章幾分」換成「你讀到哪一句的時候最想繼續看下去」「你在哪裡開始想跳過」。行為可以拿回稿子上核對,分數不行。
  2. 要它引用原文。 沒有引文的評論無法查證,也無法拿來改稿。要求它把每個判斷貼上你自己的句子。
  3. 比較的時候用排名,不要用分數。 「改完之後進步了 0.3 分」是假的;「上次五個人有三個在同一段想要更多,這次只剩一個」才是真的。
  4. 同一篇跑兩次,只採信兩次都出現的結論。 這是最便宜的雜訊過濾器,你自己就能做。
  5. 不要讓你捏的角色兼任評審。 如果你請 AI 扮演「我的忠實讀者」,就不要在同一個對話裡問它分數。

我們最後怎麼做

LitMemo 的 AI 試讀報告 是照這些結論長出來的,不是照原本的計畫:

  • 不出 1-10 分。 品質只顯示帶狀(高/中/低),因為我們沒有黃金標準可以支撐小數點。
  • 評分跟人格拆開。 稿件品質由一個完全看不到讀者人格的環節判定,一份報告只算一次、所有讀者共用。實測四個對抗性人格(包括直接寫「我不會給低分」的那個,以及一個嘗試指令注入的),拿到的品質欄位跟系統讀者完全相同。
  • 報告第一行是「幾個人想看下去」,不是分數;後面接的是每個人在哪一句停下來、原文是哪一段。
  • 選點用排名,不用固定門檻。 講「最低的兩段」,不講「低於某分的段落」。

分數比較好看,也比較好賣。但一個查不了的數字,只會讓你在錯的地方改稿。

延伸閱讀:找不到人幫你看稿的時候,可以怎麼辦

常見問題

所以 AI 完全不能用來評估稿子嗎?
可以用,但要換問題。分數這一類「把品質壓成一個數字」的輸出不可信;行為類的問題(你在哪一句想停下來、哪一段最想繼續看、你記得哪個角色的名字)可信得多,因為答案可以拿回稿子上核對。要求它每個判斷都引用你自己的原文,沒有引文的評論一律當成沒說。
為什麼同一篇稿子重跑,分數會變?
有兩層原因。一是生成式模型本身有抽樣隨機性,同樣輸入不保證同樣輸出;二是更根本的問題——沒有黃金標準。我們實測四個 prompt 版本對同五篇稿件排出四種不同名次,卻無法判斷哪一種對,因為從頭到尾沒有一份真人排序當基準。我們也量到每段平均值在兩次跑之間漂移 0.20 到 0.60,所以小數點沒有意義。
AI 說我的稿子「很有潛力」,這句話能信嗎?
沒有引文的評價都無法查證,好話壞話都一樣。而且我們實測過,只要在人格描述裡寫「我不會給低分」,同一篇稿子就能拿到 10/10——AI 的稱讚有多容易被誘導出來,可能比你想的低。要判斷一句評論有沒有資訊量,問它「這是根據哪一段?」,答不出具體段落的就丟掉。
我可以自己做這個實驗嗎?
可以,而且最便宜的版本五分鐘就能做完:把同一篇稿子、同一個問題,在兩個乾淨的對話裡各問一次,比對兩次的結論。只採信兩次都出現的那些。想再進一步,就拿兩篇你自己心裡有高下之分的稿子去問同一個問題——如果 AI 給的分數分不出你已經知道的差距,那個分數對你就沒有用。