OpenAI GPT 開源模型|筆電也能跑的本地 AI 實測
更新於 2026年2月11日
📥 工作流 JSON 下載:GitHub 範例庫 | 💬 社群討論:Skool 雲端方程式 Cloud F1
專業導讀
OpenAI 居然開源了!我第一次聽到這個消息的時候也是嚇了一跳——gpt-oss 這個名字就是在告訴你,這是 OpenAI 官方正式釋出的開源推理模型。我實際拿我的 Apple M4 晶片來測試,GPU 直接一路向北、99% 頂到底,但跑出來的結果確實還不錯。
先講結論:整體 gpt-oss 看起來比 DeepSeek R1 好一些些,但還是跟 API 版本有落差。 如果你想在本地跑 AI、不想付 API 費用、或者需要處理敏感資料,這篇文章我會帶你從 Ollama 安裝到實際測試,完整走一遍。
你將學到
- OpenAI gpt-oss 開源模型的 120b 與 20b 版本差異
- 用 Ollama 最新版一鍵部署本地 AI(含內建對話視窗)
- Apple M4 實測數據:GPU、RAM、回應速度完整記錄
- gpt-oss vs DeepSeek R1 vs o3 的 Benchmark 實戰比較
- 搭配 n8n 自動化的進階應用場景
OpenAI gpt-oss 開源模型是什麼?
OpenAI gpt-oss 是 OpenAI 正式隆重推薦的開源推理模型,分為 120b 和 20b 兩個版本,主打私有部署與低成本的開源高階推理能力,任何人都可以透過 Ollama 免費下載並在本地電腦上運行。
我自己看到 OpenAI 發布 gpt-oss 的時候,第一個想法就是「終於」。這個模型在 Ollama 上 7 個小時前才開放下載,下載的速度非常快很驚人。基本上就是 120b 跟 20b 這兩個主要的開源權重推理模型。
為什麼我覺得這個模型值得關注?因為它願意被使用的原因就是兩個字:私有部署跟低成本。你不用把資料傳到雲端、不用按 Token 計費,自己的電腦跑完就好。
gpt-oss 跟其他模型到底差多少?
我用 Perplexity 來做了兩件事情的數據對比。第一個是大模型大拜拜的比較表,第二個是整體的 Benchmark 是長怎麼樣的。
| 比較項目 | gpt-oss 120b | gpt-oss 20b | DeepSeek R1 | o3 | 說明 |
|---|---|---|---|---|---|
| 整體評分 | 略強 | 中上 | 基準線 | 最強 | gpt-oss 對標 DeepSeek 略強 |
| AIME 測試 | 最強 | 強 | 中 | 強 | 數學推理能力突出 |
| GPQA 測試 | 中 | 中 | 較強 | 最強 | 研究生等級問答有差距 |
| 參數量 | 120B | 20B | 671B | — | 有輕量化版本可選 |
| 本地可跑性 | 需高階硬體 | 筆電可跑 | 需高階硬體 | 雲端 API | 20b 是本地部署首選 |
| 成本 | 免費 | 免費 | 免費 | API 計費 | 開源最大優勢 |
所以你可以看到,gpt-oss 在 AIME 裡面真的很猛、最強,可是在 GPQA 裡面就輸人家。我覺得就是參考值,我們就實際試試看到底效果怎麼樣。
Alex 的實戰觀察
我自己實測 gpt-oss 最大的感受就是——它的內容比 DeepSeek 好蠻多的。大概就是比 DeepSeek 強一些,但跟 o3 比的時候差異就很明顯。
GPU 直接頂到底的真實體驗
我這次測試的設備是 Apple M4 的晶片,10 core 的 CPU、10 core 的 GPU 跟 16 core 的神經網路 GPU,32GB 的 RAM。反正測試的時候我只看到 GPU 往上噴,就沒有掉下來過。
我問了一個簡單的問題「天空為何是藍的」,你可以看到左邊的 GPU 整個炸上來,99% 直接頂到底,完全沒有要回來的意思。但跑出來的結果其實是可以的,做得還不錯——它從太陽光的組成、可見光是什麼、到雷射的散射,一步一步講得很詳細。
跟 o3 的對比讓我印象深刻
我同時開了兩個視窗做對比測試——左邊是 gpt-oss 本地端,右邊是 o3 的 API。兩邊同時點、同時跑,右邊這個 o3 跑的就相對比較輕鬆一點,沒有這麼多複雜的推論過程。
兩邊其實內容是有差的,當然跟呈現的方式可能也有關係。但 o3 的回應明顯更快,而 gpt-oss 的速度就是差強人意。可是跟我們用 API 的時候其實還是差滿多——不過我覺得我欣賞的是它的答案其實還不錯。
誠實的限制說明
這邊我要老實說幾個缺點:
- 速度真的沒有那麼快。它會先用英文做推論,然後再去講中文的內容,整個過程比 API 慢很多
- GPU 佔用率極高。測試期間 99% 頂滿,你同時跑其他軟體會受影響
- 模型大小 13GB。對於記憶體比較小的電腦會吃力
但話說回來,如果小孩子想要考自然、考數學,其實你可以用一下這個本地的 ChatGPT 幫他回答答案。如果你需要處理敏感資料、不想花 API 費用,本地模型就是目前最好的選擇。
本地部署完整步驟
好,接下來我帶你實際部署。我會用 Ollama 最新版本,因為它現在有一個超方便的功能——內建對話視窗,你就不用去下載 Open UI 了。
步驟 1:下載最新版 Ollama
到 Ollama 官網 下載最新版本的程式。最新版最大的改進就是內建了對話視窗,直接就能跟模型聊天。
macOS(推薦用 Homebrew):
# 安裝 Ollama
brew install ollama
# 確認安裝成功
ollama --version
Windows / Linux: 到官網下載對應版本的安裝包。
步驟 2:選擇並下載 gpt-oss 模型
打開 Ollama 的對話視窗,你可以看到這裡可以選擇一個模型。麻煩你選 gpt-oss 20b——第一次對話的時候它會自己下載模型。
# 或用終端機下載
ollama pull gpt-oss:20b
# 查看已下載的模型清單
ollama list
模型的大小大概是 13GB 左右,下載完成後就可以開始使用。
步驟 3:暖機與第一次測試
# 互動式對話
ollama run gpt-oss:20b
第一次你的畫面不會跟我一樣快,因為它會有一個暖機的動作。我已經暖完機了所以它回得很快。你可以先問一個簡單的問題,像是「我是誰」之類的,讓模型先載入記憶體。
步驟 4:觀察 GPU 使用狀況
# macOS 用 Activity Monitor 或終端機工具觀察 GPU
# 你會看到 GPU 在回答問題時直接往上噴
反正測試的時候就看 GPU Usage 有沒有暴上去——正在推論的時候,GPU 一路向北,完全沒有要回來的意思。
步驟 5:搭配 n8n 使用(進階)
因為 Ollama 的 API 格式跟 OpenAI 相容,你可以直接在 n8n 裡面接上 Ollama。前面的集數我們教過怎麼用 Ollama 去搭配 n8n AI Agent,把 Base URL 改成 http://localhost:11434 就行了。
效能實測比較
硬體環境
- 晶片:Apple M4
- CPU:10 core
- GPU:10 core + 16 core Neural Engine
- 記憶體:32GB
- 模型:gpt-oss 20b(約 13GB)
實測結果對比
| 測試項目 | gpt-oss 本地 | o3 API | 說明 |
|---|---|---|---|
| 暖機時間 | 需要暖機 | 即時 | 第一次載入較慢 |
| 簡單問答 | 可用但慢 | 很快 | 差距明顯 |
| 回答品質 | 蠻詳細的 | 更精簡 | 各有特色 |
| GPU 佔用 | 99% 頂滿 | 0%(雲端) | 本地需大量 GPU |
| 推論過程 | 先英文再翻譯 | 直接中文 | 本地有語言切換 |
| 每月成本 | $0 | 依用量 | 長期本地省錢 |
| 資料隱私 | 完全本地 | 傳送雲端 | 敏感資料首選本地 |
我的實測心得
我自己的感覺是,gpt-oss 的答案品質其實還不錯——像是問天空為什麼是藍的,它會從太陽光的組成、可見光、到散射原理,一步一步講得很詳細。但速度真的跟 API 有差,如果你需要即時回應的場景(像客服機器人),還是建議用 API。
一個我覺得很實用的做法是:簡單任務用本地模型,複雜任務才打 API。這樣既省錢又保護隱私。
開源模型 vs 閉源 API:怎麼選?
| 考量因素 | 選 gpt-oss 開源 | 選閉源 API |
|---|---|---|
| 預算有限 | 免費,長期省錢 | 按量計費 |
| 資料隱私要求高 | 資料不出本機 | 需要傳送到雲端 |
| 需要離線使用 | 不需網路 | 必須聯網 |
| 追求最高品質 | 接近 DeepSeek R1+ | GPT-4/o3 仍是最強 |
| 快速原型開發 | 需要自己部署 | API 即開即用 |
| 客製化需求 | 可微調、改架構 | 只能調提示詞 |
| 團隊技術能力 | 需要基礎 DevOps | 只需會呼叫 API |
| 硬體要求 | 至少 16GB RAM + GPU | 無要求 |
我的建議是不用二選一。把開源模型當作你的「本地 AI 引擎」,把閉源 API 當作「雲端超級大腦」,根據任務性質自動切換。在 n8n 裡面你甚至可以設定一個 IF 節點來自動判斷,簡單任務走本地,複雜任務走 API。
搭配 n8n 的進階應用
Ollama 的使用本地端大概就是這樣,當然你可以配合 n8n。我在前面的集數教過怎麼用 Ollama 去搭配 n8n AI Agent,這邊列幾個實用場景:
場景 1:私密文件摘要
把公司內部文件丟進 n8n workflow,用本地 gpt-oss 做摘要,資料完全不會離開你的電腦。適合處理合約、人事資料、財務報表等敏感文件。
場景 2:自動化翻譯
搭配 n8n 翻譯工作流,用本地模型做初步翻譯,再用 GPT-4 API 做品質校正。成本只有全部用 API 的 1/3。
場景 3:RAG 知識庫
把本地模型接上 Qdrant 向量資料庫,建立完全私有的 RAG 系統。我自己用這個方案來管理技術文件,查詢速度快、資料又安全。
場景 4:開發測試環境
在開發新的 AI workflow 時,用本地模型做測試,確認邏輯正確後再切換到正式的 API。這樣可以避免在除錯階段浪費 API 額度。
重點整理
- gpt-oss 是 OpenAI 正式發布的開源推理模型——分為 120b 和 20b 兩個版本,主打私有部署與低成本推理
- 實測結果大概就是對標 DeepSeek R1 再強一點點——在 AIME 測試最強,但 GPQA 輸人家,整體略強一些
- Ollama 最新版內建對話視窗——你就不用去下載 Open UI 了,直接選模型就能開聊
- Apple M4 跑 20b 版本 GPU 99% 頂滿——可以跑但速度差強人意,需要 32GB RAM 比較舒服
- 模型大小大概是 13GB——下載速度很快,第一次使用需要暖機
- 答案品質其實還不錯——但跟 API 比速度差很多,適合不緊急的離線任務
- 搭配 n8n 可以做更多——私密文件摘要、自動翻譯、RAG 知識庫,全部都能在本地完成
常見問題 FAQ
我的電腦需要什麼硬體規格才能跑 gpt-oss 20b?
你需要至少 16GB RAM 和約 15GB 的硬碟空間,有 GPU 加速會好很多。 我測試用的是 Apple M4 晶片、32GB RAM,跑起來 GPU 直接 99% 頂到底,但結果是可用的。如果你用的是 Apple Silicon(M1/M2/M3/M4)Mac,GPU 加速是自動啟用的。Windows 和 Linux 用戶如果有 NVIDIA 顯卡也能享受 GPU 加速。我建議至少 32GB RAM 會比較舒服,不然跑模型的時候其他應用程式可能會卡住。
gpt-oss 跑中文的效果到底怎麼樣?
基本對話中文是可以的,做得還不錯,但推論過程會先用英文再翻譯成中文。 我實測問「天空為何是藍的」,它會先用英文做推論思考,然後再把結果翻譯成中文告訴你。這個過程會增加回應時間,但答案品質是 OK 的——從太陽光組成到散射原理都講得很詳細。如果你需要高品質中文輸出,建議在 Modelfile 裡加上系統提示「請用繁體中文回答」。
Ollama 最新版的對話視窗好用嗎?需要另外裝 Open UI 嗎?
不用了!最新版 Ollama 已經內建對話視窗,你就不用去下載 Open UI。 你打開 Ollama 會發現它有一個對話視窗可以使用,直接選擇 gpt-oss 20b 就能開始聊。第一次對話的時候它會自己下載模型,我已經下載好了所以很快。對於不想搞太多設定的人來說,這個更新真的很方便。
gpt-oss 跟 DeepSeek R1 到底誰比較強?
整體 gpt-oss 看起來比 DeepSeek R1 好一些些,但各有強項。 我用 Perplexity 做了完整的 Benchmark 比較:在 AIME(數學推理)測試裡面 gpt-oss 真的很猛、最強;可是在 GPQA(研究生等級問答)裡面就輸人家。當然這個只是戰力對照表,基本上就是對標 DeepSeek V3 再比它強一點。我覺得就是參考值,實際使用效果還是要自己測試才知道。
本地模型可以搭配 n8n 自動化嗎?具體怎麼做?
可以,因為 Ollama 的 API 格式跟 OpenAI 相容,直接改 Base URL 就行。 前面的集數我們教過怎麼用 Ollama 去搭配 n8n AI Agent。在 n8n 裡面你只要把 OpenAI 節點的 Base URL 改成 http://localhost:11434,模型名稱填 gpt-oss,就能直接用了。詳細設定可以看我的另一篇 n8n + Ollama 本地 LLM 教學。
120b 版本需要什麼等級的硬體?一般人跑得動嗎?
120b 版本需要非常高階的硬體,一般消費級電腦基本上跑不動。 我這次測試的是 20b 版本,光是 20b 就已經讓 M4 的 GPU 99% 頂滿了。120b 的話,模型大小可能超過 60GB,你需要至少 64GB 以上的 RAM。如果你是一般使用者,我建議先從 20b 開始,效果已經不錯了。120b 比較適合有伺服器等級硬體的公司或研究機構。
下一步行動
🎓 想更有系統地學會這些技巧? 到 AI 職場工作術(雲端方程式 Cloud F1 旗艦課程) 看看完整的實作路徑。
如果你看完這篇想動手試試,我建議的順序是:
- 先裝最新版 Ollama,用內建對話視窗下載 gpt-oss 20b 跑一輪測試
- 觀察你的硬體負載(GPU、RAM),確認你的電腦跑得動
- 試著在 n8n 裡面接上本地模型,建立你的第一個混合 AI workflow
想學更多 n8n 自動化技巧? 加入我們的 Skool 社群,我們把所有相關的資料都全部放在 Classroom 裡面,包含 gpt-oss 的完整測試筆記!
相關資源
- n8n + Ollama 本地 LLM 教學 - 完整的 n8n 搭配本地模型設定指南
- LLM 概念指南 - 大型語言模型基礎知識
- RAG 概念指南 - 用本地模型做 RAG 知識庫
- n8n + Qdrant RAG 教學 - 向量資料庫搭配 n8n 實作
- YouTube 完整教學 EP38
- Skool 雲端方程式 Cloud F1 社群(免費加入)
- Ollama 官網
- OpenAI 開源專案 GitHub
本文改編自 YouTube 影片 EP38,由 Alex Hsieh 撰寫。最後更新:2026-02-11
關於作者:Alex 是一位專注於 n8n 自動化和 AI 應用的技術教育者,透過 YouTube 頻道和 Skool 社群幫助超過數千位學員掌握自動化技能。