n8n 字幕翻譯自動化|用 AI 一鍵產生多語言字幕完整教學
更新於 2026年2月11日
📥 工作流 JSON 下載:GitHub 範例庫 | 💬 社群討論:Skool 雲端方程式 Cloud F1
專業導讀
你有沒有遇過這種情況?錄完一支教學影片,結果光是處理字幕就花了好幾個小時。手動聽打逐字稿、調整時間軸、格式化標點符號,整個人都快崩潰了。我自己以前也是這樣,每支影片的字幕製作都是最痛苦的環節。
後來我用 n8n 打造了一套完整的自動化系統,從上傳音檔到產出逐字稿和 SRT 字幕檔,全部自動跑完。我在影片裡直接 Demo 整個流程:「我們直接 Demo 整個流程,這個自動化流程我們主要能夠做四件事情:第一個把音訊變成文字,第二個是自動化處理逐字稿包含校正,第三個是生成 SRT 的字幕檔案,第四個是快速的歸檔跟分類。」
就像我在影片最後說的:「自動化起來效率就直接 100 分了。」
這篇文章會帶你完整走過我的字幕自動化方案,從 Google Drive 設定到 SRT 輸出,每一步都講清楚。
你將學到
- Google Drive 工作資料夾的前處理設定方法
- n8n Google Drive Trigger 的觸發機制與檔案類型篩選
- OpenAI Whisper API 音檔轉逐字稿的完整設定
- ChatGPT 審稿校對、標點符號修正的 Prompt 設計
- SRT 字幕檔的 HTTP Request API 生成方法
- 逐字稿存入 Google Docs 的自動化步驟
- 完成作業後的檔案管理與歸檔策略
什麼是 n8n 字幕翻譯自動化?
n8n 字幕翻譯自動化是一套完整的影片字幕處理工作流,透過 n8n 串接 Google Drive 觸發器、OpenAI Whisper API(語音轉文字)與 ChatGPT(校對與格式化),讓你只要把音檔上傳到 Google Drive,就能自動產生校對過的逐字稿 Google 文件和 SRT 字幕檔,全程無需人工介入。
我在影片裡用一支教學影片的音檔做示範,整個系統的核心流程分為五個步驟:
- 上傳觸發 — 把 MP3 音檔上傳到 Google Drive,系統自動偵測新檔案
- Whisper 轉錄 — 用 OpenAI Whisper API 把音訊轉成文字逐字稿
- AI 審稿校對 — 用 ChatGPT 修正拼字錯誤、加上標點符號、調整格式
- 產出逐字稿 — 把校對後的內容存入 Google Docs 文件
- 生成 SRT — 透過 Whisper API 的 SRT 格式生成字幕檔,存到 Google Drive
- 歸檔管理 — 把處理完的音檔移到完成作業資料夾,保持工作區域乾淨
就像我在影片裡說的:「透過這個簡單的自動化流程,現在做影片或者是會議紀錄,逐字稿跟字幕的效率提升好幾倍。以前都要整合好幾項工具,現在一鍵完成就是很快。」
這個流程適合兩大場景:企業內部的會議紀錄,以及線上課程的字幕製作。
為什麼需要字幕自動化?
讓我帶你看一下手動處理跟自動化的差距有多大。
效率對比
| 指標 | 手動處理 | n8n 自動化後 | 改善幅度 |
|---|---|---|---|
| 30 分鐘音檔轉錄 | 2-3 小時 | 3-5 分鐘 | 省 95%+ |
| 標點符號校對 | 30-60 分鐘 | AI 自動完成 | 完全自動 |
| SRT 時間軸製作 | 1-2 小時 | API 自動生成 | 完全自動 |
| 檔案歸檔管理 | 手動分類 | 自動移動 | 零人工 |
| 每月處理 20 支影片 | 80-100 小時 | 2 小時 | 省 97% |
我在影片裡有一個很重要的觀察:逐字稿和字幕檔是兩件不同的東西。就像我說的:「逐字稿是完整的音訊轉文字的內容,適合進一步的編輯跟整理,比如說會議記錄。字幕檔像 SRT 則包含時間的戳記,適用於影片字幕的自動匹配。」
Whisper API 費用極低
我在影片裡用的是 OpenAI 的 Whisper API,定價是 $0.006/分鐘。一支 30 分鐘的影片只要 $0.18 美金(約 5.4 台幣),比外包聽打便宜上百倍。
Alex 的實戰觀察
我在建這套系統的過程中,踩了不少坑,這邊跟大家分享幾個重要的觀察。
Google Drive 的資料夾結構設計是整個流程穩定運行的基礎。 我在影片一開始就強調了前處理:「我們必須要建立工作的資料夾,是做預處理的部分。」我在 Google Drive 裡建了四個子資料夾:音訊檔的存放區(根目錄)、逐字稿資料夾、字幕檔資料夾、和完成作業資料夾。這樣設計的目的是什麼?就像我在影片裡說的:「整個資料夾的構成是清楚明確,而且你很方便後面所有的作業,你知道發生什麼事的。」
檔案類型的篩選非常重要,不是什麼檔案都要處理。 我在流程裡加了一個 If 判斷:「確保只有處理音訊檔的部分,其他的檔案不要。我們只對 MP3 檔案進行後續的轉換。」如果你跳過這一步,萬一有人不小心上傳了一個 PDF 到同一個資料夾,整個流程就會出錯。
Whisper 轉錄出來的逐字稿,一定要再經過 AI 審稿。 這是我在影片裡花了很多時間示範的部分。Whisper 的準確率很高,但是轉錄出來的文字「標點符號不完整、格式不夠流暢」。所以我加了一個 OpenAI Review 的步驟,讓 ChatGPT 化身審稿人:「幫我們 review 文字的校對並且進行修正。」
老實說,Prompt 的設計就是整個審稿品質的關鍵。 我在影片裡展示了我的 Prompt:「你是繁體中文的智能助理,你的任務是修正轉錄文本中的拼字錯誤。」但很重要的是,我特別要求:「僅修正錯誤跟標點符號,不要改原本的內容。」因為逐字稿就是要忠於原始音檔,不能讓 AI 大改特改。
SRT 字幕檔在 Google Drive 裡面其實是 TXT 格式。 這個小細節很多人不知道。我在影片裡有特別提到:「雖然 SRT 是字幕檔案,但在 Google Drive 裡面它是 TXT 檔,要記得。」所以在上傳到 Google Drive 的時候,不用特別處理格式,直接當文字檔上傳就好。
完整建置步驟
好,接下來我帶你一步一步把這套系統建起來。我在影片裡把每個 Step 都講得很詳細,你跟著做就對了。
前置作業:建立 Google Drive 工作資料夾
在建立 n8n 工作流之前,你需要先在 Google Drive 建立資料夾結構。我在影片裡示範了這個步驟:
n8n-transcript/
├── (根目錄) # 放 MP3 音訊檔,觸發自動化
├── 逐字稿/ # 存放轉錄後的 Google Docs 逐字稿文件
├── 字幕檔/ # 存放生成的 SRT 字幕檔
└── 完成作業/ # 處理完成的音檔移到這裡
我在影片中說明每個資料夾的用途:「音訊檔的資料夾存放原始的音訊檔案,例如 MP3 或者是 WAVE。逐字稿的資料夾存放轉換以後的逐字稿文件。字幕檔的資料夾存放 SRT 的字幕文件。最終完成作業的資料夾存放完成處理的檔案。」
這樣設計的好處是:「當音訊檔處理完畢以後,我們就會被移動到完成作業的資料夾,確保整個流程順利的執行。」不會搞混哪些已經處理、哪些還沒處理。
Step 0:Google Drive Trigger — 上傳音檔觸發自動化
這一步是整個流程的起點。當你把 MP3 音檔上傳到 Google Drive,系統就會自動偵測並觸發處理程序。
我在影片裡設定了兩個事件偵測:
事件一:File Created(新檔案建立)
- 使用 Google Drive API 的 Created File 事件
- 監控指定資料夾的 URL
- 每五分鐘偵測一次(也可以調整成每分鐘)
事件二:File Updated(檔案變更)
- 如果你重新上傳或覆蓋檔案,也會觸發事件
- 確保修正版本的檔案也能自動被處理
我在影片裡解釋了為什麼需要兩個事件:「只要有新的音檔被建立,系統就會觸發事件。再來就是當檔案發生變更的時候,系統就會再次偵測最新版本,就會被納入處理的範圍。」
檔案類型篩選
觸發之後,我加了一個 If 節點來檢查檔案類型:「JSON FileExtension 是 MP3,確保只有處理音訊檔的部分,其他類型的檔案我們就不會處理。」
整個觸發機制總結:「MP3 上傳到 Google Drive 裡面,就會自動偵測並且觸發處理程序。當你把工作流打開的時候,它就會自動運行。」
Step 1:Whisper API — 音檔轉逐字稿
確認是 MP3 檔案之後,接下來就是用 OpenAI 的 Whisper API 做語音轉文字。
1.1 取得檔案屬性(Set File ID)
先用一個 Set 節點把檔案的三個屬性獨立出來:ID、mimeType、Name。我在影片裡解釋:「我們把這三個屬性獨立出來方便後續的使用。也就是說每個檔案都會有自己的身分證,我們根據這個身分證把它下載下來。」
1.2 下載音檔
用 Google Drive 節點,根據 File ID 下載音訊檔案。下載完成後就準備好進行轉錄了。
1.3 Whisper API 轉錄
用 n8n 的 OpenAI 節點,選擇 Transcribe a Recording 功能:
- 把 MP3 檔案上傳到 Whisper API
- Whisper 會把音訊內容轉換成文字
- 輸出成 TXT 格式的逐字稿
我在影片裡說:「把音訊檔上傳到 OpenAI 的 API,利用 OpenAI 提供的 Transcribe a Recording 功能,把 MP3 檔案上傳到 Whisper API 進行轉錄。Whisper 會把音訊的內容轉換成文字並且輸出成 TXT 檔。」
Step 1.5:OpenAI Review — AI 審稿校對
這一步是整個流程品質提升的關鍵。我在影片裡花了很多時間說明為什麼需要這一步。
Whisper 轉錄出來的文字會有幾個問題:標點符號不完整、格式不夠流暢、偶爾有拼字錯誤。所以我用 ChatGPT 做第二層處理。
Prompt 設計:
你是繁體中文的智能助理,你的任務是修正轉錄文本中的拼字錯誤。
我在影片裡特別強調審稿的原則:
- 調整格式跟標點符號(逗號、句號、換行)
- 僅修正錯誤跟標點符號,不要改原本的內容
- 確保轉錄的內容忠於原始的檔案,不要大改特改
- 儘量以逐字稿為主
審稿完成後,左邊是原始逐字稿,右邊是修訂後的版本。我在影片裡驗證了結果:「審稿機器人會讓我們的輸出更為精確,更為格式 OK 的內容。」
Step 2:生成 Google 文件 — 儲存逐字稿
審稿完成後,把校對過的逐字稿存入 Google Docs 文件。
2.1 建立 Google Document
用 Google Docs 節點的 Create 操作:
- 存放位置:指定 Google Drive 的逐字稿資料夾(用 Folder ID)
- 檔案名稱:使用原始音檔名稱加上 Transcript 和時間戳。例如:
EP1-1 AI 自動化 Demo - Transcript 2026-01-15
我在影片裡說:「我們會根據原始的音檔名稱,產生一個對應的 Google 文件,後面加一個 Transcript 或寫轉錄跟時間戳,方便你來管理跟辨識。」
2.2 寫入逐字稿內容
建立文件後,系統會回傳 Document ID。再用 Google Docs 節點把審稿後的內容寫入這份文件。
我在影片裡確認結果:「我們發現這個文件是逐字稿,內容正確。我們的逐字稿不僅被生成,而且它有做整理的動作。」最終你會得到「一個像 Word 一樣的逐字稿文件」。
Step 3:生成 SRT 字幕檔
如果你的音檔要用在影片上,就需要生成 SRT 格式的字幕。我在影片裡解釋了原因:「SRT 是最好的選擇,因為 SRT 裡面包含時間戳記,每個文字都會有特定的時間區段,會有字幕的效果。」
3.1 HTTP Request 呼叫 Whisper API
這一步用 HTTP Request 節點直接呼叫 OpenAI 的 Whisper API,跟 Step 1 不同的是,這次要求回傳 SRT 格式。
設定要點:
- Method: POST
- URL:
api.openai.com/v1/audio/transcriptions - Header: Content-Type 設為
Multipart/Form-Data - Body (Form Data):
model: whisper-1file: 使用 n8n 的 Binary Fileresponse_format: srt(這是關鍵!)
我在影片裡有個很實在的提醒:「這個 Response Format 就是 API 要求的格式,其實在 OpenAI 的網站都有寫。那我相信大家是不會去看的,所以我幫你寫好了,直接使用就沒有問題。」
3.2 轉換成 TXT 檔案
API 回傳的 SRT 內容本質上是純文字。我用一個 Convert to File 節點把它轉成檔案:
- Input/Output field:
data - 檔案名稱:
Subtitle.srt
我在影片裡說:「這邊沒有特別的需求,你就照著我這個來。」
3.3 上傳到 Google Drive
用 Google Drive 節點上傳到字幕檔資料夾:
- Input data field:
data - 檔案名稱: 原始音檔名稱 +
Subtitle+ 時間戳 - 目標資料夾: 用 URL 指定字幕檔資料夾
上傳完成後可以到 Google Drive 確認。我在影片裡打開字幕檔驗證:「這邊其實就是單純的時間戳記搭配你的內容,字幕檔案的內容是 OK,可以搭配影片來做使用。」
Step 4:任務完成 — 移動到完成作業資料夾
最後一步是檔案管理。我在影片裡解釋了為什麼需要這一步:「要確保檔案能夠有效的管理,避免沒有處理和已完成的檔案混在一起,造成重複觸發或造成混亂。」
用 Google Drive 節點的 Move 功能:
- 指定要移動的檔案 ID(最前面 Set File ID 取得的)
- 目標資料夾:完成作業資料夾的 URL
移動完成後:「原始的工作資料夾理論上就會保持清空,未來就不會混在一起。所以最終就是把處理好的放進來,確保流程自動化管理。」
各方案比較
| 方案 | 時間成本 | 金錢成本 | 準確率 | 檔案管理 | 適合對象 |
|---|---|---|---|---|---|
| n8n + Whisper | 5 分鐘 | $0.18/影片 | 95%+ | 全自動歸檔 | 定期產出的創作者 |
| 手動聽打 | 3 小時 | $0 | 100% | 手動管理 | 偶爾需要的人 |
| 外包人力 | 1 天 | $500-1000 | 95% | 需要溝通 | 有預算的團隊 |
| YouTube 自動字幕 | 1 分鐘 | $0 | 80% | 無法管理 | 不在意品質的人 |
| Descript/Otter.ai | 10 分鐘 | $20/月 | 90% | 平台內管理 | 不想折騰的人 |
我的觀察是,n8n + Whisper 的最大優勢在於全自動化加上完整的檔案管理。就像我在影片裡設計的,所有的資料都集中在 Google Drive,你可以後續修改、管理、尋找過去做的紀錄。這是其他方案做不到的。
重點整理
- 前置作業:建立四個 Google Drive 子資料夾(根目錄、逐字稿、字幕檔、完成作業),這是整個流程穩定運行的基礎
- Google Drive Trigger 偵測兩種事件:File Created 和 File Updated,確保新檔案和修正版本都能被處理
- 檔案類型篩選必不可少:只處理 MP3 格式,其他類型的檔案不要觸發流程
- Whisper API 轉錄準確率高,但一定要加上 ChatGPT 審稿校對,修正標點符號和拼字錯誤
- 審稿 Prompt 的原則:僅修正錯誤,不要大改特改,忠於原始檔案
- SRT 生成的關鍵:在 HTTP Request 的 response_format 參數設為 srt,API 就會自動生成包含時間戳記的字幕
- 檔案歸檔策略:處理完成後用 Move 把音檔移到完成作業資料夾,保持工作區清空,避免重複觸發
- 所有資料集中 Google Drive:方便後續查看、編輯、管理,可以節省非常多時間
常見問題 FAQ
Whisper API 支援哪些音檔格式?檔案大小有限制嗎?
Whisper API 支援 MP3、MP4、M4A、WAV、WEBM 等常見音檔格式,檔案大小限制為 25MB。 我在影片裡用的是 MP3 格式,因為體積最小、相容性最好。如果你的檔案超過 25MB,建議先用 FFmpeg 降低位元率轉成 MP3。我在流程裡也有加檔案類型檢查:只對 MP3 或 WAV 格式進行後續轉換,其他類型不處理,避免出錯。
OpenAI Whisper 和 ChatGPT 的 API 費用大概多少?
Whisper API 每分鐘 $0.006 美金,ChatGPT 4o-Mini 的費用更低。以一支 30 分鐘的影片計算,整個流程(轉錄 + 審稿)大約只要 $0.20-0.30 美金,大概台幣 6-9 元。 如果你每月處理 20 支影片,總成本大約台幣 120-180 元。跟外包聽打(一支影片 $500-1000 台幣)或月訂閱的 SaaS 工具($20 美金/月)比起來,真的便宜太多了。
為什麼需要 ChatGPT 審稿?直接用 Whisper 的逐字稿不行嗎?
Whisper 轉錄的準確率很高,但輸出的文字通常缺少標點符號,而且格式不夠流暢。 我在影片裡特別示範了這個差異:左邊是 Whisper 第一次轉錄的原始內容,右邊是經過 ChatGPT 審稿後的版本。審稿會做幾件事:調整格式跟標點符號,修正偶爾的拼字錯誤,讓逐字稿更好讀。但我的原則是「不要大改特改,儘量以逐字稿為主」,確保忠於原始音檔的內容。
SRT 字幕檔可以直接上傳 YouTube 嗎?
完全可以。 YouTube 支援標準 SRT 格式,上傳後會自動解析時間軸和字幕內容。我在影片裡生成的 SRT 檔包含完整的時間戳記和對應文字,格式完全符合標準。要注意的一點是,就像我在影片裡提到的,SRT 在 Google Drive 裡面存的是 TXT 格式,但下載後改副檔名為 .srt 就可以直接使用。
這套系統除了影片字幕,還適合什麼場景?
我在影片裡提到兩大適用場景:企業內部的會議紀錄,以及線上課程的字幕製作。 會議紀錄的話,你只要把會議錄音的 MP3 上傳,就能自動產生有標點符號的逐字稿 Google 文件,方便團隊查看和編輯。線上課程的話,每堂課錄完直接上傳音檔,SRT 字幕和逐字稿一次搞定。逐字稿還能拿來改寫成部落格文章或社群貼文,一魚多吃。
可以同時處理多個音檔嗎?
可以,這也是用 Google Drive Trigger 的好處。 你一次上傳多個 MP3 檔案到資料夾,系統會按照偵測順序依序處理。我的 Trigger 設定是每五分鐘偵測一次,你也可以調成每分鐘。每個檔案處理完成後會自動移到完成作業資料夾,所以不會搞混。就像我在影片裡說的:「所有的資料都集中在 Google Drive,你可以後續修改,也可以管理去尋找過去做的紀錄。」
下一步行動
🎓 想更有系統地學會這些技巧? 到 AI 職場工作術(雲端方程式 Cloud F1 旗艦課程) 看看完整的實作路徑。
如果你看完這篇想動手試試,我建議你按這個順序來:
- 先在 Google Drive 建好 n8n-transcript 資料夾和四個子資料夾
- 在 n8n 裡建立 Google Drive Trigger 節點,設定偵測 File Created 事件
- 設定好 OpenAI API Key
- 按照本文的步驟建立完整工作流
- 用一支短音檔(5 分鐘以內)測試整個流程
- 確認逐字稿和 SRT 都正確後,開啟 Workflow 讓它自動運行
就像我在影片最後說的:「免費的模板提供給大家,連結在下方文件敘述欄,只要下載 JSON 檔匯入就可以了。」
先求大概懂,再開始用,最後才能做成功!
想學更多 n8n 自動化技巧? 加入我們的 Skool 社群,和其他自動化愛好者一起學習交流!
相關資源
- n8n 超級翻譯機完整教學 — 多語言翻譯自動化進階版
- n8n 零基礎完整教學 2026 — 從安裝到第一個工作流
- n8n 自動化完整指南 — 自動化策略與最佳實踐
- n8n Google OAuth 設定 — Google 服務認證教學
- n8n 功能完整指南 — 所有節點功能介紹
- YouTube 完整教學:EP02 字幕翻譯自動化
- GitHub 工作流模板
- OpenAI Whisper API 文件
- n8n Google Drive 節點文件
✍️ 關於作者:Alex 是一位專注於 n8n 自動化和 AI 應用的技術教育者,透過 YouTube 頻道和 Skool 社群幫助超過數千位學員掌握自動化技能。