研究者做出高中生的 AI 素養客觀測驗,補上只靠自評的缺口
2026/08/28
一份研究提出並驗證了一套針對高中生的生成式 AI 素養客觀測驗。這件事的價值不在測驗本身有多精巧,而在於它處理了一個目前普遍存在、卻很少被正面面對的方法學問題:我們其實不太知道學生的 AI 素養到底如何。
原因在於現行的測量方式。國際上大量的 AI 素養調查採用自評式問卷——請學生為「我能判斷 AI 回答是否正確」這類敘述打分。這種方法快速、便宜、容易大規模施測,但它測的是自信,不是能力。而在新技術領域,自信與能力的關係往往是扭曲的:使用頻率高的學生自評分數通常很高,但頻繁使用不等於會判斷;相反地,理解模型侷限的學生反而可能因為知道問題複雜而給自己較低的分數。
當政策決定建立在自評資料上,風險就出現了。學校可能因為調查結果看起來不錯而認為不需要加強教學,或反過來把資源投在錯誤的地方。
客觀測驗要處理的正是這一段。它不問學生覺得自己會不會,而是給出具體任務讓他們做——例如提供一段生成內容,請學生指出其中不可靠的部分並說明理由;或給出兩種提問方式,請學生預測哪一種較可能得到偏誤的回答。答案有對錯,能力因此可以被外部檢核。
這類工具的意義有幾個層面。對學校而言,它讓「教了之後有沒有差」變成可回答的問題,前後測比較可以真正評估課程效果。對研究者而言,它讓不同國家、不同課程模式的結果具備可比性。對政策制定者而言,它提供了比自評更可靠的現況基準。
當然,客觀測驗也有它的限制,而且必須誠實看待。第一是效度的持續性——AI 工具變化快速,今天測得準的題目,兩年後可能因為模型行為改變而失效,因此需要持續更新。第二是測驗容易導致教學窄化:一旦某套測驗被廣泛採用,教學就可能向題型靠攏,而 AI 素養最重要的部分——面對沒見過的情況時的判斷——恰恰最難出成標準題。第三,這是一份預印本階段的研究,後續仍需要更多獨立驗證。
業界分析人士指出,任何新能力被納入教育體系的過程都會經歷同一個階段:先有理念,再有課程,最後才出現可靠的評量,而評量出現的時間點通常決定了這項能力是否會被認真對待。
對台灣的教育研究與現場來說,這個方向值得關注。如果本地要推動 AI 素養課程,同步發展可用的評量工具會比只發展教材更有價值——因為沒有評量,就沒有辦法知道教得好不好。