OpenAI 在官方部落格公布了與義大利博科尼大學(Università Bocconi)研究人員合作進行的一項教育領域隨機實驗結果[1]。這項實驗以 1,000 多名大學一年級學生為對象,分別檢驗使用 ChatGPT 與接受批判性思考訓練對學生成果的影響。兩者的作用明顯不同,而且彼此互補。
分成四組的實驗設計
實驗場景是博科尼大學 1,000 多名大學一年級學生所完成的實務課題[1]。題目是為校內商品店擬定行銷方案,學生依課堂時段隨機分入四組:可使用 ChatGPT(GPT-4o)的一組、接受因果推理訓練的一組、兩者兼具的一組,以及兩者皆無的對照組。
這裡所說的因果推理訓練,鍛鍊的是把原因與結果連結起來、說明某項方案為何有效或在什麼情況下會失敗的能力。訓練內容與 AI 無關,透過遊戲形式的練習、實例、提問與回饋來講解概念[1]。
繳交的作業由受過訓練的人工評分者依五分制評分表評分,另外也以自動文字分析測量每份作業的想法數量與多樣性、因果推理的痕跡,以及與三位專家所寫方案的相似度[1]。
使用 ChatGPT 讓分數提高將近 1 分
能夠使用 ChatGPT 的一組,在五分制評分中拿到接近高出 1 分的成績[1]。他們的答案包含更多想法,邏輯更清楚,與專家方案的相似度也更高。換句話說,AI 讓新手寫出看起來更專業的成果。
不過研究明確指出,學生並沒有把作業整份丟給 ChatGPT。決定要問什麼、評估回覆的內容、挑選哪些內容放進最終版本,這些環節仍然由學生自己完成[1]。
訓練的效果並未反映在評分表上
更出乎意料的是批判性思考訓練這一側。完成練習的學生能更清楚說明自己的想法為何可行、在什麼條件下會失敗,但評分表上的分數並沒有提高[1]。
原因出在評分表的設計。這次實驗使用的評分表只檢視方案在多大程度上回應了兩個標準行銷目標:提升校內商品店的知名度與使用率[1]。而自動文字分析呈現出另一種效果:完成練習的一組產出的想法範圍更廣,與同學之間的重複度更低。結構工整的答案拿得到分數,沒有人想到過的創意卻拿不到分數,評分表的盲點就此浮現。
兩項都接受的學生進步範圍最廣
同時取得 ChatGPT 使用權限與批判性思考練習的一組,疊加呈現出兩方面的效果[1]。他們的想法多樣性與只做練習的一組相當,評分表分數與想法數量則與只用 ChatGPT 的一組相當,此外邏輯連貫性更強,尋找解釋、質疑前提的痕跡也更多。就整體測量指標來看,這一組在最廣的範圍內出現改善。
教育領域的討論常被框成培養獨立思考或培養會用 AI 的二選一,但實驗結果指向的方向是:兩者各有各的價值。
受到質疑的是衡量的尺規本身
這次結果更值得重視的一點,是對學校評量方式的提醒。當 AI 讓學生輕鬆產出看起來專業的成果時,只看最終答案已經很難判斷學生究竟理解了什麼[1]。OpenAI 的解讀是,原創性、推理過程以及考量過多種方案的痕跡,都需要納入評量範圍。
博科尼大學於 2025 年 5 月與 OpenAI 達成合作,成為義大利第一所向全體 17,000 名學生、教師與職員提供 AI 工具的大學[2]。OpenAI 今年 3 月也公布了用於長期衡量學習成果的 Learning Outcomes Measurement Suite,並將博科尼大學列為進行學習與就業交叉研究的院校之一[3]。這次實驗正位於這一系列工作之中。
總結
這次實驗的意義在於,以隨機化設計把兩種性質不同的效果區分開來:使用 ChatGPT 提升了答案的品質與邏輯性,批判性思考訓練則拓寬了想法的廣度。另一方面,研究對象是同一所大學一年級學生的單一課題,期間也有限。結論能否直接套用到其他教育現場,還需要後續的重複驗證。
來源:https://openai.com/index/what-students-gain-from-chatgpt-critical-thinking-training
來源:https://www.unibocconi.it/en/news/bocconi-and-openai-join-forces-transform-ai-social-sciences
來源:https://openai.com/index/understanding-ai-and-learning-outcomes/
