研究:AI 為學生作文打的分數,普遍比人類評分者寬鬆

研究:AI 為學生作文打的分數,普遍比人類評分者寬鬆

2026/08/27

一項研究發現 AI 在評閱學生作文時,傾向給出比人類評分者更高的分數。當學校開始把評分工作交出去,這個系統性偏差會直接影響學生看到的回饋與最終成績。

一項研究發現,AI 在為學生作文評分時,普遍給出比人類評分者更高的分數。這個結果本身不讓人意外,但它的後果值得學校認真對待——因為越來越多機構正在把初評、給回饋、甚至部分正式評分的工作交給 AI。

先看這個偏差可能從哪裡來。目前的通用模型在訓練與調校過程中,被大量引導成有幫助、鼓勵性、避免打擊使用者的回應風格。這種傾向放到評分情境,就會表現為對缺點的低估與對優點的放大。此外,模型對「寫得好」的判斷高度依賴表層特徵——結構完整、段落清楚、用詞正式、句型變化——而這些正是最容易被模仿的部分。相對地,論證是否真的成立、證據是否支撐結論、有沒有實質洞見,是模型最不擅長分辨的層次。

這會產生一個具體的風險:一篇結構工整但論點空洞的作文,很可能拿到偏高的分數;而一篇結構鬆散但確實提出了有趣觀點的作文,可能被低估。如果學生據此調整寫作策略,他們學到的會是「把形式做漂亮」,而不是「把想法想清楚」。這正好與寫作教育的目標相反。

分數偏高的第二個後果是回饋失去作用。學生從高分中得到的訊息是「這樣就可以了」,於是停止修改。寫作能力的成長高度依賴具體、指得出問題的回饋,而寬鬆評分等於把這個機制關掉。

這不代表 AI 在寫作教學中沒有位置。它在某些任務上確實有用:檢查引用格式、指出前後不一致、標示過長難讀的句子、提供改寫建議讓學生比較。這些都是低風險、高頻率、人類做起來耗時的工作。問題只出在把最終的價值判斷交出去。

實務上比較穩健的配置有幾種。一是把 AI 定位為第一輪的形式檢查,實質評分仍由教師負責。二是若要用 AI 輔助評分,先用一批已由教師評過的樣本做校準,實際量出偏差幅度,再決定是否採信。三是在評分規準中,明確把「論證是否成立」與「表達是否清楚」拆開計分,讓表層品質無法掩蓋內容空洞。

業界分析人士指出,自動評分系統的問題往往不在準確率的平均值,而在偏差的方向是否一致——系統性偏高比隨機誤差更危險,因為它不會被平均掉,只會持續往同一個方向累積。

對台灣的學校來說,如果已經在使用或評估 AI 批改工具,值得先做一件很簡單的事:挑三十份已經批改過的作文重跑一次,把兩邊分數並列比較。差距的大小與方向,會比任何廠商簡報都更能說明這個工具適不適合用在你的課堂。