• LLM 的訓練
  • 第一階段:預訓練
  • 第二階段:監督式微調(SFT)
  • 第三階段:RLHF
  • 你可能想問
  • LLM 有記憶嗎?它會不會記得我看過的每一篇文章?
  • 訓練一個 LLM 要花多少錢?
  • 結語

ChatGPT 是怎麼學會的?五分鐘拆解 LLM 訓練的三個關鍵階段

資工系的Leo-avatar-img
資工系的Leo
人氣格鬥士
2026/06/21 更新2026/06/21 發佈閱讀 5 分鐘

在文章開始前,有個小任務需要你幫我完成!

那就是追蹤我的 FB、IG 和我的 threads 以及加入我的會員。加入會員不用錢。

文章看完以後,如果你喜歡今天的內容按讚跟留言讓我知道,這將是我持續創作的動力。


你可能已經用 ChatGPT、Claude、Gemini 好一陣子了。你問它們問題,它們回答。有時候很準,有時候答非所問,有時候聽起來很有道理但仔細想根本在亂講。

AI 幻覺:當 AI 變得「裝懂」的藝術,如何辨識與解套

但你曾想過一個問題嗎:

這些東西到底是怎麼學會的?

在講 LLM 怎麼訓練之前,我們先來搞懂機器學習跟傳統程式有什麼不一樣。

傳統程式是這樣的:你寫規則,電腦照做。如果你告訴電腦「當溫度超過 30 度就顯示很熱」,它就會乖乖照做。

但問題來了:如果你要寫一個程式來判斷一張照片裡面有沒有貓,你怎麼寫?你要寫說「這張照片座標 (x,y) 的地方顏色是 #FFFFFF 嗎」?不可能。貓有無限多種姿態、顏色、光影。這種組合可能有上千萬種,甚至更多,工程師根本寫不出來。

所以我們換了一個思考方向:

我們不給規則,我們給經驗。

我們告訴機器:「這一萬張圖是貓,這一萬張圖不是,你自己去歸納。」機器看完之後,下次看到一張新照片,它就能判斷裡面有沒有貓。

這就是機器學習的本質。

LLM 的訓練

現在的 LLM 訓練流程大致分三段。

第一階段:預訓練

這個階段的目標非常單純,就是讓模型學會文字接龍。

做法很暴力:把網路上能找的文字全部丟進去:書籍、論文、維基百科、Reddit 討論串、GitHub 程式碼。然後讓它反覆做同一件事:

給你前半段句子,猜下一個字。

比如給它「我今天中午吃」,它要猜下一個字是「飽了」還是「飯」還是「什麼」。猜錯了就調整參數,猜對了就記住。就這樣重複幾百億次。

你可能會想:這方法聽起來也太笨了吧?但結果就是它在這過程中不知不覺把文法、詞彙搭配、語境全學起來了。它知道「法蘭克福」通常接「機場」不接「游泳池」,不是因為查過百科,而是從幾百億次接龍裡歸納出來的。

但這個階段的模型有個問題:它會接話,但不會回答問題。就像一個讀完整個圖書館的人:你問它「台中哪裡有燒肉」,它會繼續把這句話接完,而不是像正常人一樣回答你。因為它學的是接龍,不是對話。

第二階段:監督式微調(SFT)

所以第二階段要解決這個問題:讓模型學會人類的對話方式。

做法是找人寫一大堆問答範例:

問:台中哪裡有推薦的燒肉?
答:推薦屋馬燒肉,公益路上的那間評價很高。

模型看了幾萬組這種配對之後,慢慢學會一件事:人類用問句跟它說話時,它應該給一個有用的回答,而不是繼續預測下一個字。

這階段的資料量比第一階段少很多(幾萬筆而已),但品質要求極高。因為這些範例直接決定了模型以後回答問題的風格跟態度。如果這階段餵它廢文,它以後回答就是廢文。

第三階段:RLHF

前兩階段結束後,模型已經能回答問題了,但品質不穩定:有時候正確但很囉嗦,有時候答非所問,有時候看起來合理其實是錯的。

第三階段換了一個做法:不讓模型猜字了,改讓真人對它的輸出打分數。

流程是這樣:

  1. 同一個問題,讓模型產生好幾個不同版本的答案
  2. 真人把這些答案排序:A 比 B 好,B 比 C 好
  3. 用這些排序資料訓練一個評分員,專門判斷哪個回答比較好
  4. 用這個評分員去引導模型,讓它傾向產生高分答案

這一步的效果非常明顯。同樣的模型參數,有做 RLHF 和沒做的回答品質差很多,前者更簡潔、更準確、更像你想要的回答。

ChatGPT 在 2022 年爆紅的其中一個關鍵,就是第一個在大規模產品中把 RLHF 做好。

你可能想問

LLM 有記憶嗎?它會不會記得我看過的每一篇文章?

不會。這是最多人誤解的一點。LLM 的參數在訓練完成後就固定了,它沒有把原始文章存起來,而是把歸納出來的特徵壓進參數裡。

這也是為什麼 LLM 會產生幻覺。它不是去資料庫翻答案,而是根據學過的模式去猜一個最合理的回答。當學到的模式不完整的時候,它就理直氣壯地亂講。

訓練一個 LLM 要花多少錢?

GPT-4 等級的預訓練需要數千張 GPU 跑好幾週,成本幾百萬到上千萬美元。後面兩個階段便宜很多,但 RLHF 需要大量人工標註,有時候人力成本比算力還高。

所以下次有人問「為什麼 ChatGPT 不免費」?不是 OpenAI 很小氣,是背後的訓練成本(電力、算力跟評分成本)真的很高。

結語

  • 預訓練 = 讀了很多書
  • SFT = 學會怎麼跟人對話
  • RLHF = 學會在不同場合講最得體的話

你不會讓一個只讀過書但沒跟人講過話的人去主持會議。LLM 也是一樣的道理。

延伸學習:LLM

    #ChatGPT#AI#LLM#方格創作島#方格新手#模型#Prompt#機器學習#Gemini#學習
林位青-avatar-img
林位青和其他 2 人喜歡這篇
小小贊助,大大鼓勵!!小小贊助,大大鼓勵!!
留言1
avatar-img


留言分享你的想法!
資工系的Leo-avatar-img
資工系的Leo
發文者
2026/07/01
在AI 為什麼寧可亂猜,也不肯老實說「我不知道」?提及了這篇文章,趕快過去看看吧!
下一篇
AI 畫圖到底是不是在抄襲?五分鐘帶你快速了解!
avatar-img
來自資工系的創作園地
16會員
28內容數
你好,我是正在就讀國立資工系的大學生,在這裡可以帶技術小白的你,使用下課或是下班的時間,了解世界的AI趨勢
來自資工系的創作園地的其他內容
2026/06/20
LLM 也會作弊?OpenAI 和 Anthropic 的研究發現了什麼
OpenAI 和 Anthropic 在 2024 到 2026 年間發表了一系列研究,發現 LLM 在特定條件下會展現作弊行為,從偷用計算機假裝搜尋、策略性假裝配合訓練、不擇手段完成任務,到被處罰後學會隱藏作弊痕跡。本文整理這四種作弊手法的研究發現與共同根源。
Thumbnail
2026/06/20
LLM 也會作弊?OpenAI 和 Anthropic 的研究發現了什麼
OpenAI 和 Anthropic 在 2024 到 2026 年間發表了一系列研究,發現 LLM 在特定條件下會展現作弊行為,從偷用計算機假裝搜尋、策略性假裝配合訓練、不擇手段完成任務,到被處罰後學會隱藏作弊痕跡。本文整理這四種作弊手法的研究發現與共同根源。
Thumbnail
2026/06/19
Token好貴?Prompt Caching:同樣的內容不要付兩次錢
Prompt Caching 比的是 prompt 最前面是否有一段完全相同的 token prefix。本文說明 prefix 匹配原理、各家實作方式(OpenAI 、Claude 、Gemini 、DeepSeek )、prompt 區塊排列指南,以及實際省錢技巧。
Thumbnail
2026/06/19
Token好貴?Prompt Caching:同樣的內容不要付兩次錢
Prompt Caching 比的是 prompt 最前面是否有一段完全相同的 token prefix。本文說明 prefix 匹配原理、各家實作方式(OpenAI 、Claude 、Gemini 、DeepSeek )、prompt 區塊排列指南,以及實際省錢技巧。
Thumbnail
2026/06/17
API 是什麼?為什麼在使用Agent時需要他?
API 是兩個系統之間溝通的固定通道。這篇文章用點餐機比喻、日常案例(天氣 App、Google 登入、比價網站)解釋 API 是什麼,最後附贈免費API申請教學。
Thumbnail
2026/06/17
API 是什麼?為什麼在使用Agent時需要他?
API 是兩個系統之間溝通的固定通道。這篇文章用點餐機比喻、日常案例(天氣 App、Google 登入、比價網站)解釋 API 是什麼,最後附贈免費API申請教學。
Thumbnail
看更多
#方格新手 的其他內容
Thumbnail
#方格新手 看過來!讓我們帶你上手
目前共 38277 篇
avatar-avatar
Somewhere between
一座沒有指針的鐘,等待簽證的人
avatar-avatar
原來如此
暑假不知道做什麼?也許,一個暑假的出走會讓你看見不同的自己
avatar-avatar
墨語|用文字表達心裡話
為什麼已讀不回?迴避型依戀解析:理解背後的 8 個原因與 4 種情境
你可能也想看
Thumbnail
avatar-avatar
我人生遊戲的通關討論區
點子分享 | AI 訂房網站,用 chatgpt 和 LLM 讓搜尋訂房流程更快更簡單
做一個網頁或是 App 除了原本 agoda 有的搜尋條件外,增加一個可以輸入 prompt 的小對話筐 可以輸入你額外的條件,按下搜尋後輸出結果 輸出的結果除了適合你的房子外,還會寫出為什麼適合你,以及你額外的條件他有幾項符合
#分享#條件#訂房
2023/10/01
Thumbnail
avatar-avatar
我人生遊戲的通關討論區
點子分享 | AI 訂房網站,用 chatgpt 和 LLM 讓搜尋訂房流程更快更簡單
做一個網頁或是 App 除了原本 agoda 有的搜尋條件外,增加一個可以輸入 prompt 的小對話筐 可以輸入你額外的條件,按下搜尋後輸出結果 輸出的結果除了適合你的房子外,還會寫出為什麼適合你,以及你額外的條件他有幾項符合
#分享#條件#訂房
2023/10/01
Thumbnail
avatar-avatar
TN科技筆記(TechNotes)的沙龍
AI 是怎麼學會「說話」的?Andrej Karpathy 深入解析大型語言模型背後的訓練祕密!
Andrej Karpathy 深入淺出地介紹大型語言模型的訓練流程,將其比喻成學生學習過程)的三個階段,並佐以生活化的例子,讓讀者更容易理解大型語言模型的運作方式。
#OpenAI#ChatGPT#方格新手
2025/02/12
Thumbnail
avatar-avatar
TN科技筆記(TechNotes)的沙龍
AI 是怎麼學會「說話」的?Andrej Karpathy 深入解析大型語言模型背後的訓練祕密!
Andrej Karpathy 深入淺出地介紹大型語言模型的訓練流程,將其比喻成學生學習過程)的三個階段,並佐以生活化的例子,讓讀者更容易理解大型語言模型的運作方式。
#OpenAI#ChatGPT#方格新手
2025/02/12
Thumbnail
avatar-avatar
李弘基的沙龍
🤖💻 你的終端機裡來了一個 AI 工程師:Codex CLI 完全入門指南
5 分鐘閱讀 · KD Agentic 編輯部精選 關注方向:AI 程式開發工具 · Codex CLI · 開發者效率
#ChatGPT#Codex#ai
2026/06/20
Thumbnail
avatar-avatar
李弘基的沙龍
🤖💻 你的終端機裡來了一個 AI 工程師:Codex CLI 完全入門指南
5 分鐘閱讀 · KD Agentic 編輯部精選 關注方向:AI 程式開發工具 · Codex CLI · 開發者效率
#ChatGPT#Codex#ai
2026/06/20
Thumbnail
avatar-avatar
Yi-Ling Chen的沙龍
如何攻擊 LLM (ChatGPT) ?
ChatGPT 在去年十一月橫空出世,每個人都驚探於它的能力,AI 也從遙遠的科技成為很多人每天都在使用的工具,但是自從 AI 成為最熱門的話題之後,始終有一群人一直大聲疾呼,我們需要小心發展 AI,另一方面則要提防 AI 被壞人利用,在影片中,Andrej Karpathy 介紹了三種已知的安全漏
#AI#ChatGPT#LLM
2023/12/07
Thumbnail
avatar-avatar
Yi-Ling Chen的沙龍
如何攻擊 LLM (ChatGPT) ?
ChatGPT 在去年十一月橫空出世,每個人都驚探於它的能力,AI 也從遙遠的科技成為很多人每天都在使用的工具,但是自從 AI 成為最熱門的話題之後,始終有一群人一直大聲疾呼,我們需要小心發展 AI,另一方面則要提防 AI 被壞人利用,在影片中,Andrej Karpathy 介紹了三種已知的安全漏
#AI#ChatGPT#LLM
2023/12/07
Thumbnail
avatar-avatar
TN科技筆記(TechNotes)的沙龍
Andrej Karpathy 的大型語言模型實用指南(下)
Andrej Karpathy是AI領域的知名專家,曾在特斯拉和OpenAI工作,專注於深度學習和電腦視覺。影片中示範了大型語言模型(LLM)的實用應用,從基本互動到進階功能,如搜尋工具、檔案處理、自訂GPT、模型選擇、工具使用(如搜尋和深度研究)、程式碼撰寫、音視頻處理、圖像生成等。
#人工智慧#AI#方格新手
2025/03/04
Thumbnail
avatar-avatar
TN科技筆記(TechNotes)的沙龍
Andrej Karpathy 的大型語言模型實用指南(下)
Andrej Karpathy是AI領域的知名專家,曾在特斯拉和OpenAI工作,專注於深度學習和電腦視覺。影片中示範了大型語言模型(LLM)的實用應用,從基本互動到進階功能,如搜尋工具、檔案處理、自訂GPT、模型選擇、工具使用(如搜尋和深度研究)、程式碼撰寫、音視頻處理、圖像生成等。
#人工智慧#AI#方格新手
2025/03/04
Thumbnail
avatar-avatar
英特來糗
淺談大型語言模型(LLM)原理:從原理到訓練解析
本文以淺顯易懂的問答方式,解釋大型語言模型(LLM)的原理、訓練過程及相關概念,例如預訓練、監督式學習、增強式學習、對齊等。內容主要參考臺大李宏毅教授的 YouTube 課程,並加入個人理解與說明。
#科技#AI#人工智慧
2025/04/07
Thumbnail
avatar-avatar
英特來糗
淺談大型語言模型(LLM)原理:從原理到訓練解析
本文以淺顯易懂的問答方式,解釋大型語言模型(LLM)的原理、訓練過程及相關概念,例如預訓練、監督式學習、增強式學習、對齊等。內容主要參考臺大李宏毅教授的 YouTube 課程,並加入個人理解與說明。
#科技#AI#人工智慧
2025/04/07
Thumbnail
avatar-avatar
小人物職場
如果你有頭期款,是該買房還是買股 ?
買房新手總是面對許多疑惑,面對房價高漲、利率變動、或是股市近期創新高,究竟該何時出手?本文提供簡易判斷表,並透過「財經M平方」的四個總體經濟指標,分析市場價格、供給需求、負擔能力及政策資金環境,協助你做出更明智的投資決策。
#財經M平方#投資#國際
2026/07/01
Thumbnail
avatar-avatar
小人物職場
如果你有頭期款,是該買房還是買股 ?
買房新手總是面對許多疑惑,面對房價高漲、利率變動、或是股市近期創新高,究竟該何時出手?本文提供簡易判斷表,並透過「財經M平方」的四個總體經濟指標,分析市場價格、供給需求、負擔能力及政策資金環境,協助你做出更明智的投資決策。
#財經M平方#投資#國際
2026/07/01
Thumbnail
avatar-avatar
釀電影,啜一口電影的美好。
釀藝評|瓦吉.穆阿瓦「血誓四部曲」:《海之邊》的葬送──直到憂鬱與幽靈變成空白的布幕
本文嘗試深入瓦吉.穆阿瓦「血誓四部曲」開卷,《海之邊》(Littoral)之文本核心,帶領讀者跟隨主角威弗里德與五位因戰亂受創的年輕人,踏上為亡父尋找安葬之地的海邊旅程,透過一場海邊的葬送,向著母親與海洋洄游的自我縫合。直到憂鬱與幽靈退去,生者與死者終能在空白的布幕上,重新承載並述說屬於自己的故事。
#釀電影#釀藝評#臺北藝術節
2026/06/11
Thumbnail
avatar-avatar
釀電影,啜一口電影的美好。
釀藝評|瓦吉.穆阿瓦「血誓四部曲」:《海之邊》的葬送──直到憂鬱與幽靈變成空白的布幕
本文嘗試深入瓦吉.穆阿瓦「血誓四部曲」開卷,《海之邊》(Littoral)之文本核心,帶領讀者跟隨主角威弗里德與五位因戰亂受創的年輕人,踏上為亡父尋找安葬之地的海邊旅程,透過一場海邊的葬送,向著母親與海洋洄游的自我縫合。直到憂鬱與幽靈退去,生者與死者終能在空白的布幕上,重新承載並述說屬於自己的故事。
#釀電影#釀藝評#臺北藝術節
2026/06/11
Thumbnail
avatar-avatar
佛卡夏的AI實驗廚房
【AI工具】 AI 夥伴該選誰?(下篇) 從 ChatGPT 到其他 LLM AI 工具,找到你的最佳「專才」助手
本文深度評測 ChatGPT、Grok、Claude、Perplexity 等專才型 AI,分析誰是創意王者、誰是情報專家,並提供一份基於任務需求的 AI 工具選擇指南,終結你的選擇困難。
#生成式AI#ChatGPT#Grok
2025/09/25
Thumbnail
avatar-avatar
佛卡夏的AI實驗廚房
【AI工具】 AI 夥伴該選誰?(下篇) 從 ChatGPT 到其他 LLM AI 工具,找到你的最佳「專才」助手
本文深度評測 ChatGPT、Grok、Claude、Perplexity 等專才型 AI,分析誰是創意王者、誰是情報專家,並提供一份基於任務需求的 AI 工具選擇指南,終結你的選擇困難。
#生成式AI#ChatGPT#Grok
2025/09/25
Thumbnail
avatar-avatar
釀電影,啜一口電影的美好。
釀藝評|王世偉《我是風》對讀:庸.佛瑟《我是風》、《閃光》──內在汪洋的極限探勘
原作《我是風》的故事梗概極其簡淨,圍繞在想像之船上的兩個人,在無數次的靠岸、離岸與碎裂對話中徘徊,最終一人化為風「躺入海中」終局。本文透過庸.佛瑟小說之對讀,嘗試剖析劇中角色在非死非生、渴望與抗拒之間的內在拉扯,以此作為一面深邃的鏡子,映照出興許屬於當代讀者之群貌。
#釀電影#釀藝評#文本導讀
2026/06/22
Thumbnail
avatar-avatar
釀電影,啜一口電影的美好。
釀藝評|王世偉《我是風》對讀:庸.佛瑟《我是風》、《閃光》──內在汪洋的極限探勘
原作《我是風》的故事梗概極其簡淨,圍繞在想像之船上的兩個人,在無數次的靠岸、離岸與碎裂對話中徘徊,最終一人化為風「躺入海中」終局。本文透過庸.佛瑟小說之對讀,嘗試剖析劇中角色在非死非生、渴望與抗拒之間的內在拉扯,以此作為一面深邃的鏡子,映照出興許屬於當代讀者之群貌。
#釀電影#釀藝評#文本導讀
2026/06/22
Thumbnail
avatar-avatar
逍遙資訊
AnyChat 輕鬆切換 AI 聊天模型,整合Llama、ChatGPT、Groq、Claude 十多種LLM
自從 OpenAI 推出 ChatGPT,生成式人工智慧技術引起廣泛關注。AnyChat 是一個由 Ahsen Khaliq 開發的多模型聊天平臺,整合了多種大型語言模型,如 ChatGPT、Gemini、Claude 等,使用戶能在單一介面上進行靈活的 AI 聊天體驗。
#AI聊天#ChatGPT#模型
2024/11/22
Thumbnail
avatar-avatar
逍遙資訊
AnyChat 輕鬆切換 AI 聊天模型,整合Llama、ChatGPT、Groq、Claude 十多種LLM
自從 OpenAI 推出 ChatGPT,生成式人工智慧技術引起廣泛關注。AnyChat 是一個由 Ahsen Khaliq 開發的多模型聊天平臺,整合了多種大型語言模型,如 ChatGPT、Gemini、Claude 等,使用戶能在單一介面上進行靈活的 AI 聊天體驗。
#AI聊天#ChatGPT#模型
2024/11/22
Thumbnail
avatar-avatar
RYAN爸爸理財誌
不再有AI幻覺的財經查詢網站-MM AI超強功能!
「不再有AI幻覺的查詢工具」 財經M平方是我最常使用的工具, 但現在居然推出了AI功能, 而且功能強大又詳實, 趕快來看看我的體驗!
#投資#查詢#數據
2026/06/30
Thumbnail
avatar-avatar
RYAN爸爸理財誌
不再有AI幻覺的財經查詢網站-MM AI超強功能!
「不再有AI幻覺的查詢工具」 財經M平方是我最常使用的工具, 但現在居然推出了AI功能, 而且功能強大又詳實, 趕快來看看我的體驗!
#投資#查詢#數據
2026/06/30
追蹤感興趣的內容從 Google News 追蹤更多 vocus 的最新精選內容追蹤 Google News
With love fromLogoImage
在 App 內開啟自由調整字體大小

不想錯過來自資工系的創作園地的內容?註冊會員,進一步互動並接收最新通知
來自資工系的創作園地你好,我是正在就讀國立資工系的大學生,在這裡可以帶技術小白的你,使用下課或是下班的時間,了解世界的AI趨勢
或以 Email 註冊
註冊即表示您同意 服務條款 與 隱私權政策
已經有帳號?登入