在文章開始前,有個小任務需要你幫我完成!
那就是追蹤我的 FB、IG 和我的 threads 以及加入我的會員。加入會員不用錢。
文章看完以後,如果你喜歡今天的內容按讚跟留言讓我知道,這將是我持續創作的動力。
他們不是答錯,是不被允許說不知道
你可能遇過這個狀況:你問 ChatGPT 一個不確定的問題,它給出了一段聽起來很有條理的回答,但你後續查證發現,他又在唬爛了。最詭異的是,它寫答案時的語氣和回答一個它完全知道的問題一模一樣。
這不是你的錯覺。也不是模型故意騙你。
OpenAI 在 2025 年 9 月發表了一篇研究(Why Language Models Hallucinate),直接點出一個違反直覺的結論:語言模型之所以會出現幻覺,現在不是因為它們太笨,是因為現行的訓練和評測方式,從頭到尾都在獎勵「猜答案」,並沒有獎勵「誠實面對不確定性」。
今天來花一點點時間帶你拆解:
為什麼 AI 寧可亂猜,也不肯說「我不知道」。
一個選擇題考試
現在想像一個場景,你現在正在考試,遇到一題問生日的題目
不過你不知道答案。你有兩個選擇:
A. 猜一個日期,1/365 的機率答對。
B. 空白不寫,直接零分。
你應該也會選擇A吧。語言模型的處境一模一樣。
現在的 benchmark 在評估模型時,絕大多數只看「答對率」。當你只計算正確答案的比例時,模型很快學會一個策略:永遠不要空白,永遠給出一個答案。因為猜了有機會對,不猜一定零分。OpenAI 用他們自己的 SimpleQA 評測來告訴我們
指標 | GPT-5 thinking-mini | o4-mini |
|---|---|---|
棄權率(不給具體答案) | 52% | 1% |
正確率 | 22% | 24% |
錯誤率(幻覺) | 26% | 75% |
o4-mini 的正確率其實比 GPT-5 thinking-mini 還高一點——24% 對 22%。但如果只看這個數字,你會覺得兩者差不多。事實上 o4-mini 的錯誤率高達 75%,因為它幾乎什麼問題都硬答。GPT-5 thinking-mini 在超過一半的問題上選擇了棄權,因此把錯誤率壓到了 26%。
兩個模型的正確率只差 2 個百分點,但體感上天差地遠。然而在大多數排行榜上,o4-mini 看起來完全不輸,因為排行榜只看你答對了多少,不管你答錯了多少。
問題比考試更深:預測下一個字的結構性缺陷
評測方式的偏差只是表面。OpenAI 的研究顯示一個更深的問題:
幻覺從訓練的第一階段就埋下了。
還記得之前說過模型的第一階段嗎,ChatGPT 是怎麼學會的?五分鐘拆解 LLM 訓練的三個關鍵階段 這個過程裡沒有「對錯標籤」。模型只看得到「這個句子是合理的語料」,從來看不到哪些說法是錯的。
你可以想像它像一個只看過貓和狗照片的人,從未見過錯誤標籤的範例。如果訓練資料裡某件事出現的頻率很高(比如拼字規則、標點符號),模型自然學得很好。但對於那些低頻率的、隨機的事實,例如:一個人的生日、一篇論文的標題、一個冷門法則,模型沒有足夠的統計信號來記住正確答案。
上述就是幻覺的溫床。如果後續的微調和人類回饋階段沒有補上這個洞,模型就只能用「機率最高聽起來最順的字串」來填空。模型就只是在完成一個看起來像是答案的句子。
不確定性不是幻覺的簡單解方
如果那讓模型學會說「我不確定」不就好了?
對,也不對。
2026 年 5 月有一篇論文(Evaluating the Relevance of Uncertainty Estimators for LLM Hallucination)系統性地測試了各種不確定性估計方法和幻覺之間的關聯。兩者的關係很不穩定,取決於幻覺的類型和模型本身。
有些情況下,當模型內部的不確定性很高時,它確實是在亂猜。但也有很多情況是,模型對一個幻覺答案很有自信,或者對一個正確答案充滿懷疑。不確定性與幻覺之間不是簡單的線性關係。
同一個月發表的 HalluWorld 基準測試(HalluWorld: A Controlled Benchmark for Hallucination via Reference World Models)進一步揭示了這個問題。研究者在棋盤、網格世界、終端操作等可控環境中測試模型,發現到:
- 「感知型幻覺」:模型對眼前資訊的解讀錯誤,對前沿模型來說幾乎已經解決。
- 「多步狀態追蹤」和「因果推演」:需要持續更新內部狀態並推演變化的任務,仍然非常困難。
- 模型在「何時應該棄權」這個決策上的表現也參差不齊。
換句話說,說「我不知道」不單是一種態度,它其實是一種需要被訓練的判斷能力。而目前的大部分模型在這方面還沒有被好好地教過。
真正該改的是評分方式,不是模型
OpenAI 在論文的結論裡做出了一個務實的建議,不是要大家去發明什麼新的幻覺檢測技術,而是先回頭修改排行榜的規則。
現在的狀況是:就算有人開發出一種讓模型會說「我不確定」的技術,這個技術在絕大多數現行 benchmark 上反而會讓模型的分數變低。因為那些 benchmark 不獎勵棄權,只獎勵答對。
對自信的錯誤回答加重扣分,對適當的不確定表達給予部分分數。
這在人類考試中並不是什麼新概念。有些考試早就用倒扣機制來抑制亂猜。問題是 NLP 領域的評測標準長期以來只看正確率,把「正確 vs 錯誤」當成唯一的二分法。只要這個激勵結構不改,模型就會一直朝著「寧可錯,也要答」的方向進化。
這對你來說代表什麼
如果你是一般使用者,這代表你應該開始留意一個事實:
AI 回答聽起來很有自信,不代表它真的確定。
這不是使用者的錯,是整個評測體系設計的問題。
如果你是在選擇要用哪個模型的人,比起只看 benchmark 分數,你可以多留意一件事:
這個模型在面對它不確定的問題時,是硬著頭皮回答,還是會誠實表達不確定。
這項能力在排行榜上看不到,但在實際使用中決定了模型是否值得信任。
至於 AI 什麼時候才能真正學會說「我不知道」,答案可能不單是技術問題,也可能還藏在評分制度。只要排行榜一天不改,模型就會繼續猜下去。
Q&A
Q:那我該怎麼讓 AI 不要亂猜?
目前最直接的做法是在 prompt 裡明確要求「如果你不確定,請直接說你不知道,不要臆測而外的想法」。雖然不是所有模型都會完全遵守,但多數前沿模型對這類指令有一定程度的遵循能力。另一個方向是把高風險查詢交給有搜尋能力的 AI,比如 ChatGPT 的搜尋功能或 RAG 架構,雖然它們也不是完美解決方案。
Q:所以幻覺永遠不會被解決?
OpenAI 的論文顯示:有些問題本質上是無法回答的,所以正確率永遠不會達到 100%。但模型可以選擇棄權。問題不在於能不能解決,而在於目前的激勵機制讓棄權變成對模型不利的行為。只要這點不改,幻覺就會持續存在。
Q:小模型會比大模型更容易說不知道嗎?
有趣的是,有時候確實如此。OpenAI 的論文舉了一個例子:如果你用毛利語問一個問題,一個完全不會毛利語的小模型可以直接說「我不知道」,而一個學過一些毛利語的大模型反而需要判斷自己到底懂多少。在某些情境下,能力有限的模型反而更容易意識到自己的邊界。
結語
如果你有看過我寫關於幻覺的文章,你再來看這篇你可能也會得到更多的想法,我也希望你可以把想法在底下留言,跟大家和我一起討論。











