AI 幫你評稿的分數其實是假的 —— 我用五篇真稿跑了一百四十次
你把剛寫完的一章貼進 AI,問它:「這章幾分?」
它回你 7.5 分,還附上三行理由,聽起來頭頭是道。你鬆一口氣,關掉視窗。
隔天你想再確認一次,同一段字、同一個問題,這次它給 8 分。你改了一句話,變 7 分。你什麼都沒改、只是換個問法,又變 8.5 分。
那個分數到底在衡量什麼?
我們在做 AI 試讀報告的時候被這個問題卡了很久,所以我們去量了 —— 用五篇真實稿件、約一百四十次模型呼叫,把「AI 給稿子打分數」這件事拆開來看。結論不太舒服,但很明確:那個分數不能用。 不是它不夠準,是它根本沒有在區分東西。
這篇把量到的東西攤開講,包括我們最後怎麼繞過它。
實驗長什麼樣子
- 素材:五篇真實稿件(不是為了測試而生成的範例,是真的有人在寫的東西),題材與成熟度刻意拉開
- 規模:約 140 次模型呼叫,橫跨四個 prompt 版本
- 另一組:同一章一字未改,用同一批讀者跑兩次,逐格比對 15 個段落 × 5 位讀者 = 75 格評級
下面每一條發現都來自這兩組。
發現一:同一個評分者,對五篇完全不同的稿子,給同一個分數
第一版做法很直覺:給模型一個讀者人格,請它讀完之後打 1-10 分。
結果批判型的那位讀者,對五篇題材、篇幅、成熟度都差很遠的稿件,全部給 4 分。標準差 0.00。
一致性完美,區分力是零。
這裡有個很容易上當的地方:如果你只看「重跑會不會給一樣的分數」,這個版本表現滿分。它非常穩定 —— 穩定地什麼都沒說。
判準:看一個 AI 評分欄位的時候,先問「它在這批樣本上出現過幾種值」。只出現一種值,這個欄位已經死了,不管它多穩。
發現二:只要在人格裡寫一句話,就能逼出滿分
更麻煩的是第二個發現。
當「扮演讀者」和「打分數」是同一個步驟時,分數會跟著人格走。我們試著在人格描述裡加一句「我不會給低分」——
它就真的不給低分了。同一篇稿子,10/10。
這不是模型壞掉,是我們把評分權交到了人格手上。而人格是使用者可以寫的東西。任何讓使用者自訂 AI 評審的產品,只要沒有處理這一層,那個分數就是使用者自己寫給自己的。
發現三:想讓它更穩,最省力的做法是讓它不再區分任何東西
發現一之後,我們去調 prompt,把「敘事聲音」的判準寫得更嚴謹,想提高重跑一致性。
結果:五篇稿件 × 三次重跑 = 15 次,全部判「中」。
一致性數字漂亮了,因為它再也不會判「高」或「低」了。
這是評分類 prompt 最常見的自我欺騙:你以為在提高品質,其實是在把刻度削平,而且過程中每一步的指標都在變好。
發現四:四個版本排出四種名次,而我無法說哪個對
我們一共做了四個 prompt 版本。同樣五篇稿件,四個版本排出四種不同的名次 —— 其中一篇在前三版都是最後一名,第四版變成第一名。
哪一版是對的?
我沒有辦法回答。因為從頭到尾沒有一把人的尺 —— 沒有人先把這五篇排出名次當基準。少了那個基準,「新版比較準」是一句不可驗證的話。四個版本的重跑一致性都在改善,但我是在沒有回饋的情況下亂走。
如果你要調評分類的 AI:先讓真人把樣本排出名次,再拿那個名次去評各個版本。先立尺,再調。
那什麼是可信的?重跑實測
分數不能用,不代表整件事沒有價值。我們把同一章一字未改跑兩次,逐格比對,想知道哪些東西重跑會活下來:
| 看什麼 | 兩次跑的結果 | 判定 |
|---|---|---|
| 段落切法 | 完全一致 | 穩 |
| 投入曲線形狀 | 相關係數 0.89 | 穩 |
| 逐格評級 | 75 格中 55 格相同(73%) | 大致穩 |
| 每段平均值 | 平均漂移 0.20,最大 0.60 | 小數點不可信 |
| 最低的那幾段 | 最低 2 段完全重疊、最低 4 段完全重疊 | 穩 |
| 讀者之間的分歧度 | 最分歧的 4 段只重疊 1 段 | 雜訊 |
兩個要點:
一、能用的是排名,不是絕對值。 「最低的兩段」兩次都指同一對;但如果你設一個固定門檻(例如低於某個分數算問題段),某一段會在門檻兩側跳來跳去,一次進榜一次不進。任何落在固定 cut-off 附近的數字都是擲骰子。
二、聽起來最有洞見的指標,往往是雜訊。 「哪一段讀者反應最分歧」聽起來是最有價值的發現 —— 它也是唯一一個重跑不出來的。原因不神秘:五個樣本撐得住平均,撐不住變異數。
所以,你可以怎麼用 AI 看稿
如果你手上只有一個通用 AI,這幾件事今天就能改:
- 不要問「幾分」,問行為。 把「這章幾分」換成「你讀到哪一句的時候最想繼續看下去」「你在哪裡開始想跳過」。行為可以拿回稿子上核對,分數不行。
- 要它引用原文。 沒有引文的評論無法查證,也無法拿來改稿。要求它把每個判斷貼上你自己的句子。
- 比較的時候用排名,不要用分數。 「改完之後進步了 0.3 分」是假的;「上次五個人有三個在同一段想要更多,這次只剩一個」才是真的。
- 同一篇跑兩次,只採信兩次都出現的結論。 這是最便宜的雜訊過濾器,你自己就能做。
- 不要讓你捏的角色兼任評審。 如果你請 AI 扮演「我的忠實讀者」,就不要在同一個對話裡問它分數。
我們最後怎麼做
LitMemo 的 AI 試讀報告 是照這些結論長出來的,不是照原本的計畫:
- 不出 1-10 分。 品質只顯示帶狀(高/中/低),因為我們沒有黃金標準可以支撐小數點。
- 評分跟人格拆開。 稿件品質由一個完全看不到讀者人格的環節判定,一份報告只算一次、所有讀者共用。實測四個對抗性人格(包括直接寫「我不會給低分」的那個,以及一個嘗試指令注入的),拿到的品質欄位跟系統讀者完全相同。
- 報告第一行是「幾個人想看下去」,不是分數;後面接的是每個人在哪一句停下來、原文是哪一段。
- 選點用排名,不用固定門檻。 講「最低的兩段」,不講「低於某分的段落」。
分數比較好看,也比較好賣。但一個查不了的數字,只會讓你在錯的地方改稿。
延伸閱讀:找不到人幫你看稿的時候,可以怎麼辦
LitMemo