Generic selectors
Exact matches only
搜索的标题
Search in content
Post Type Selectors

Sign in

a
Generic selectors
Exact matches only
搜索的标题
Search in content
Post Type Selectors
a
學習 · 2026年9月26日 · 16 分鐘閱讀

知道要小心 AI,卻不知道小心甚麼

學生用 AI 做功課快了,錯誤也多了。做功課要先想、再用,並交代思考過程

協作者:張Sir與AI

這半年,張Sir聽過不少家長、老師和學生談 AI 做功課。學生說,功課快多了。家長也輕鬆了,還說終於有信心輔導孩子,AI 在背後幫了不少忙。老師以前很在意學生有沒有用 AI,現在習慣了,不太去查,自己備課也快得多。大家起初都說滿意,多聊兩句,幾句抱怨便陸續出來:錯誤多,論證費時,推理過程沒人細看。生成式 AI,「生」就「成」了。

澳門互聯網研究學會今年六月在世界互聯網項目年會發表居民調查結果,七月再於網站刊出報告及詳細數據。張Sir七月也曾撰文分析。用戶以 5 分為滿分替自己的 AI 素養打分,「使用生成式 AI 時遵守倫理道德」平均有 4.0 分,「知道甚麼是 AI 幻覺」卻只有 2.6 分。AI 幻覺(AI hallucination)就是模型寫出看似合理、其實錯誤甚至憑空捏造的內容。另有 45% 用戶說,自己從不或只是偶爾核查 AI 給出的信息。受訪用戶給自己的倫理分數頗高,對 AI 會怎樣出錯卻不太清楚,收到答案後也未必動手查。

人為甚麼會跟着 AI 答錯

用計數機計數、用手機記電話、用導航找路,都是把一小部分工作交給工具,心理學稱為認知卸載(cognitive offloading)。張Sir年初談 AI 寫作的誤區時用過這個詞。人雖然省了力,方向盤還在自己手上,因為要算甚麼、打電話給誰、去哪裡,心裡一早清楚。

按計數機之前,人已經知道自己要算哪條數,結果離不離譜也有個大概。到了 AI,答案和理由一併出現,語氣還很有把握。讀着讀着,一不留神,連要做判斷也忘了。

賓夕法尼亞大學沃頓商學院的 Steven Shaw 與 Gideon Nave 今年一月把這種情況稱為認知放棄(cognitive surrender)。他們找來一千多人做實驗,回答一些很容易憑直覺選錯的推理題,旁邊有 ChatGPT 隨時可問。研究人員暗中動了手腳,讓 ChatGPT 在一半題目給錯答案。碰到這些錯誤答案,問過 ChatGPT 的人有八成照抄,答對的反而比完全不用 AI 的人少,信心卻更高。研究人員後來改成答對一題便給獎金,也讓參加者每做完一題立即知道對錯。肯推翻錯誤答案的人由兩成升到四成多,仍然未過半。

用 AI 做功課,學到的反而少了

實驗室裡的推理題,幾分鐘便做完,對錯也很快揭曉。學生每天靠 AI 少想一步,功課照樣交得出去,影響要過一段時間才看得出來。美國皮尤研究中心去年秋天訪問 13 至 17 歲青少年,54% 表示用過聊天機器人幫忙做功課。

沃頓商學院另一個團隊在土耳其一所高中做過實驗,讓近一千名學生分三組練習數學。一組可以隨便問 GPT-4;一組使用老師設定的 GPT Tutor,裡面有教師提供的解法和常見錯誤,通常只提示,不直接給答案;第三組只用課本。隨便問 GPT-4 的學生,練習成績比課本組高 48%,收走 AI 後再考試,成績卻低了 17%。GPT Tutor 組跟課本組相比,考試成績沒有明顯差別。AI 把答案一步步寫在眼前,學生看得「熟口熟面」,很容易當成自己已經學懂。

香港大學與斯德哥爾摩大學的團隊今年六月發表一份追蹤研究。他們查看內地中部一個縣 26,811 名初一至高三學生兩年半的紀錄,再按學生開始使用 AI 的先後時間比較。研究估計,使用 AI 後,功課分數升了 18%,做功課的時間少了三成;到了閉卷月考,成績在半年內跌了 20%,約兩年後的中考和高考成績分別跌了 24% 和 18%。研究團隊發現,約八成 AI 用戶呈現「功課外判」特徵,學習損失也主要發生在這一組。使用 AI 後仍花相若時間做功課的學生,損失較小。

有些 AI 產品近年加入學習模式,只給提示,不直接交答案,做法跟土耳其實驗的 GPT Tutor 相近。不過,學生可以自行決定是否打開。追蹤研究團隊的吳延暉近日接受《人物》訪問時說,內地市面早已有逐步講解的學習工具,多數學生仍會選即時給答案的通用 AI,把省下的時間拿去做別的事。功課若只看最後答案,學生選最快的工具很自然。老師怎樣給分,很大程度決定學生怎樣用 AI。連思考過程也計分,學生才有理由打開學習模式。

內地、香港和澳門怎樣做

國家教育部基礎教育教學指導委員會 2025 年 5 月發布《中小學生成式人工智能使用指南(2025年版)》。小學生不得獨自使用開放式內容生成功能;到了初中,要開始分析 AI 內容是否合乎邏輯;高中生則可結合技術原理做探究。指南明確禁止學生把 AI 生成的內容直接當作功課或考試答案,老師也要帶學生找出 AI 文本的漏洞。

香港教育局今年六月公布《中小學數字教育發展藍圖》。當中的《中小學應用人工智能教學指南》提醒老師,學生若用 AI 代替思考,容易變成「高技術低思維」。功課不宜讓學生直接提交 AI 生成的內容;老師可在課堂上即時口頭查問,也可要求學生交出思考過程。教育局去年底的調查顯示,54.2% 小學和 70.2% 中學已有至少一半老師使用 AI 輔助教學。

澳門方面,教青局表示已透過課程法規、教材、教師培訓和向學校提供建議指引等配套推進人工智能教育。2026/2027 學年的措施包括補充教材、培訓教師,以及資助學校設立「人工智能實驗教室」。前述居民調查顯示,不少用戶仍弄不清 AI 怎樣出錯,也沒有養成查證的習慣。

國際方面,經合組織(OECD)與歐盟委員會今年六月正式發布中小學 AI 素養框架,以批判力去評估 AI 輸出是其中一項重點;PISA 2029 也會加入「媒體與AI素養」評估領域。屆時,各地學生判斷 AI 答案的能力便有數據可供比較。

功課可以怎樣改

即使有指南,也未必管得到每一道功課。學生會不會直接問 AI 拿答案,還要看老師怎樣出題、怎樣給分。張Sir年初談中小學生用 AI 做功課時,提出過三個做法:

  • 學生先寫骨架。 做理科題,先寫已知條件、題目要求、準備使用的公式,再記下每一步的理由。做文科題,就用自己的話寫出立場、理由、例子和結論。寫得粗糙不要緊,老師反而看得到學生有沒有想過。
  • AI 坐教練位,只負責提問。 學生把骨架交給 AI,有學習模式就打開,叫它繼續追問。例如:這一步依賴甚麼前提?有沒有反例?這個例子能代表整體嗎?換個題型還成立嗎?結論是否要收窄?
  • 學生重寫定稿,交代改了甚麼。 隨功課附上一小段紀錄,寫下最初怎樣問 AI、AI 怎樣回答,自己接受和修改了哪些內容,又用了甚麼資料查證,有沒有標示 AI 參與。

用 AI 做功課三步:先寫骨架、AI 只負責提問、重寫查證標示

沃頓實驗已經給了獎金,每做完一題又立即公佈對錯,結果仍有過半人跟着 AI 答錯。學生若先寫下自己的思路,AI 答甚麼便有得比較。老師也要把一部分分數放在骨架、提問回合和重寫版本上,學生才會認真走完這三步。

張Sir一位清華大學的朋友,最近在朋友圈說起他的岳父,正好是個例子。老人家年屆九十,退休前是清華數學系教授,長年教數學分析,也參加過全國考研數學命題組,平日仍以演算數學題為樂。聽說大模型解題厲害,他便拿來逐題試,發現豆包的確又快又好。直到有一題,豆包的答案和他自己推的不一樣,他翻查推算過程,發現模型草率地把一個收斂、發散的判斷弄錯了。他指出之後,豆包很快改正,還誠懇道歉。老人家說:「原來大模型也會出錯,也不是那麼可靠!」朋友回了他一句:「認知吝嗇嘛,人機皆然。」能省力就省力,心理學叫認知吝嗇(cognitive miser)。老教授肯花這份力,自己先推了一遍,AI 的錯處才藏不住。

課堂上也可以刻意讓學生發現 AI 的錯。例如,上歷史課,學生先請 AI 解釋一個事件,再逐個查人名、年份和因果,便可能找到被它混在一起的相近事件。科學題可以從推理步驟入手,看看哪一步表面像教科書,實際已經走錯。語文課則可比較 AI 和真人寫的文章,談談為甚麼文字流暢,裡面仍然可能沒有多少想法。學生自己發現了 AI 一次錯,下次再看到同樣肯定的答案,自然會多查一步。

家長和老師想知道孩子有沒有真的想過,可以問四句:不看稿,能不能口頭講一遍?能不能舉一個反例?能不能說清楚自己改了哪裡?為甚麼改?四個問題都答得出,思考多半還掌握在學生手上。這比逐份追查孩子有沒有用 AI 省力,也更有用。

資源差距會在課室放大

同一份功課帶回家,有些學生可用付費工具,還有家長陪着;有些只有一部手機和免費版本,打開 AI 最常做的就是問答案。澳門調查也看到不同群體的差距:18 至 34 歲用戶的 AI 素養平均 3.6 分,學生群體 3.5 分,家庭主婦、退休及失業群體只有 3.2 分。家裡幫不上忙的學生,更需要學校照顧。

香港的教學指南也提醒老師,如果要求學生在家使用付費功能,或者把佔分很重的功課留在家做,評估可能有失公平。皮尤的調查還發現,約四成美國 13 至 17 歲青少年的家長從未和子女談過 AI 聊天機器人。

AI 會錯,學生最好親眼見過一次,重要答案也要學會找回資料來源核對。自己和同學的個人信息、照片、聲音,不應隨手輸入 AI。交功課時用過 AI,就清楚標示。這些都是每個學生都要學的基本數碼常識。

AI 讓答案來得很快,學校能做的,是在功課裡替學生留出先想一遍、再查一遍的時間。

後記:這篇文章怎樣寫成

這篇文章由張Sir和 AI 協作完成,前後來回二十多輪。張Sir先定下骨架,手上有年初兩篇舊文和七月的澳門調查分析,再把香港、內地及其他地方的材料加進來。開場裡家長、老師和學生說過的話,都是張Sir親耳聽到的。清華老教授的故事來自朋友分享,經朋友同意刊出。AI 幫忙找資料,也負責起草和改寫,約五分鐘便交出初稿。

之後,張Sir接着用了約五小時查證、校對和修改。初稿引用沃頓論文時,跟着學院介紹稿寫獎金加即時對錯能令人「明顯更願意」推翻錯誤答案。張Sir要求查看原文,由於網站做了反爬蟲機制,大模型爬不了,張Sir再手動下載 PDF 核對,才看到肯推翻的人只由兩成升到四成多,大多數人依然照抄。AI 又把「高技術低思維」按新聞報道歸入《學習架構》,張Sir翻開教育局原文,才確認它出自《教學指南》。內地兩萬六千名學生的追蹤研究,是張Sir要求補反面案例後找到的;另一個流傳甚廣的美國案例只能找到二手轉述,張Sir一般不太採用,最後刪去。

澳門那句「暫時未見官方公佈相關的使用指引」,原是張Sir自己的措辭。定稿前,他仍要求再查一次,結果在政府去年九月的《施政特寫》找到教青局已向學校提供建議指引的說法,原句便不能再留。發佈前,張Sir也把稿件交給另一個前沿 AI 模型交叉審閱。對方建議收窄內地研究的因果語氣,並把約數換成精確數字,這兩項改動都採用了;其他意見由張Sir逐項決定取捨。

這二十多輪改稿,大部分時間都花在翻原文、核數字。張Sir先有自己的判斷,才知道哪些地方值得追下去。那位九十歲的老教授能找出 AI 的錯,正因為他已經親手把題目推過一遍。

@張Sir的AI養生館 – 學習智人

***

參考資料

人物.(2026年9月15日)。AI正在「懲罰」那些用它寫作業的中學生。人物(微信公眾號)。

香港特別行政區政府教育局.(2026)。中小學數字教育發展藍圖(附篇二:中小學應用人工智能教學指南)。

教育部基礎教育教學指導委員會.(2025)。中小學生成式人工智能使用指南(2025年版)。中國教育和科研計算機網。

張Sir.(2026年2月10日)。AI寫作最大的誤區:你幹了,卻不負「責任」。張Sir的AI養生館。

張Sir.(2026年2月11日)。讓思考看得見:中小學生如何善用 AI 做功課?。張Sir的AI養生館。

張Sir.(2026年7月8日)。會用 AI,不等於有 AI 素養:澳門AI應用調查給教育界的啟示。澳門互聯網研究學會。

新華社.(2025年5月13日)。學生作業考試禁止人工智能「代勞」。新華網。

澳門互聯網研究學會.(2026年7月2日)。解碼生成式人工智能行為。

澳門互聯網研究學會.(2026年7月7日)。生成式AI走入日常:AI素養與新數碼鴻溝成關注焦點。

澳門特別行政區政府.(2025年9月28日)。【施政特寫】推進人工智能全學段教育及社區通識教育 聯動多方協作培育高質素科技人才。

澳門特別行政區政府.(2026年8月28日)。2026/2027學年教育及青年工作措施。

Bastani, H., Bastani, O., Sungu, A., Ge, H., Kabakcı, Ö., & Mariman, R. (2025). Generative AI without guardrails can harm learning: Evidence from high school mathematics. Proceedings of the National Academy of Sciences, 122(26), e2422633122.

OECD. (n.d.). *PISA 2029 media and artificial intelligence literacy*.

OECD & European Commission. (2026). *Empowering learners for the age of AI: An AI literacy framework for primary and secondary education*. OECD Publishing.

Pew Research Center. (2026, February 24). *How teens use and view AI*.

Shaw, S. D., & Nave, G. (2026). *Thinking—fast, slow, and artificial: How AI is reshaping human reasoning and the rise of cognitive surrender* \[Working paper]. The Wharton School, University of Pennsylvania.

Strömberg, D., Lei, V., & Wu, Y. (2026). *The generative AI learning penalty: Evidence from Chinese secondary education* (CEPR Discussion Paper No. 21577). Centre for Economic Policy Research.

115

LATEST

夜晚躺下,胃酸就往上湧

夜晚躺下,胃酸就往上湧

朋友Iris在寫字樓上班,冷氣從早開到晚,午飯常配一杯凍奶茶。飯後不久,喉嚨便湧上一口清稀...

免費訂閱「張Sir開的方」

會員登入

還沒有帳號? 立即註冊