n8n 字幕翻譯自動化|用 AI 一鍵產生多語言字幕完整教學

更新於 2026年2月11日

n8n 字幕翻譯自動化

📥 工作流 JSON 下載GitHub 範例庫 | 💬 社群討論Skool 雲端方程式 Cloud F1

專業導讀

你有沒有遇過這種情況?錄完一支教學影片,結果光是處理字幕就花了好幾個小時。手動聽打逐字稿、調整時間軸、格式化標點符號,整個人都快崩潰了。我自己以前也是這樣,每支影片的字幕製作都是最痛苦的環節。

後來我用 n8n 打造了一套完整的自動化系統,從上傳音檔到產出逐字稿和 SRT 字幕檔,全部自動跑完。我在影片裡直接 Demo 整個流程:「我們直接 Demo 整個流程,這個自動化流程我們主要能夠做四件事情:第一個把音訊變成文字,第二個是自動化處理逐字稿包含校正,第三個是生成 SRT 的字幕檔案,第四個是快速的歸檔跟分類。」

就像我在影片最後說的:「自動化起來效率就直接 100 分了。」

這篇文章會帶你完整走過我的字幕自動化方案,從 Google Drive 設定到 SRT 輸出,每一步都講清楚。

你將學到

  • Google Drive 工作資料夾的前處理設定方法
  • n8n Google Drive Trigger 的觸發機制與檔案類型篩選
  • OpenAI Whisper API 音檔轉逐字稿的完整設定
  • ChatGPT 審稿校對、標點符號修正的 Prompt 設計
  • SRT 字幕檔的 HTTP Request API 生成方法
  • 逐字稿存入 Google Docs 的自動化步驟
  • 完成作業後的檔案管理與歸檔策略

什麼是 n8n 字幕翻譯自動化?

n8n 字幕翻譯自動化是一套完整的影片字幕處理工作流,透過 n8n 串接 Google Drive 觸發器、OpenAI Whisper API(語音轉文字)與 ChatGPT(校對與格式化),讓你只要把音檔上傳到 Google Drive,就能自動產生校對過的逐字稿 Google 文件和 SRT 字幕檔,全程無需人工介入。

我在影片裡用一支教學影片的音檔做示範,整個系統的核心流程分為五個步驟:

  1. 上傳觸發 — 把 MP3 音檔上傳到 Google Drive,系統自動偵測新檔案
  2. Whisper 轉錄 — 用 OpenAI Whisper API 把音訊轉成文字逐字稿
  3. AI 審稿校對 — 用 ChatGPT 修正拼字錯誤、加上標點符號、調整格式
  4. 產出逐字稿 — 把校對後的內容存入 Google Docs 文件
  5. 生成 SRT — 透過 Whisper API 的 SRT 格式生成字幕檔,存到 Google Drive
  6. 歸檔管理 — 把處理完的音檔移到完成作業資料夾,保持工作區域乾淨

就像我在影片裡說的:「透過這個簡單的自動化流程,現在做影片或者是會議紀錄,逐字稿跟字幕的效率提升好幾倍。以前都要整合好幾項工具,現在一鍵完成就是很快。」

這個流程適合兩大場景:企業內部的會議紀錄,以及線上課程的字幕製作。


為什麼需要字幕自動化?

讓我帶你看一下手動處理跟自動化的差距有多大。

效率對比

指標手動處理n8n 自動化後改善幅度
30 分鐘音檔轉錄2-3 小時3-5 分鐘省 95%+
標點符號校對30-60 分鐘AI 自動完成完全自動
SRT 時間軸製作1-2 小時API 自動生成完全自動
檔案歸檔管理手動分類自動移動零人工
每月處理 20 支影片80-100 小時2 小時省 97%

我在影片裡有一個很重要的觀察:逐字稿和字幕檔是兩件不同的東西。就像我說的:「逐字稿是完整的音訊轉文字的內容,適合進一步的編輯跟整理,比如說會議記錄。字幕檔像 SRT 則包含時間的戳記,適用於影片字幕的自動匹配。」

Whisper API 費用極低

我在影片裡用的是 OpenAI 的 Whisper API,定價是 $0.006/分鐘。一支 30 分鐘的影片只要 $0.18 美金(約 5.4 台幣),比外包聽打便宜上百倍。


Alex 的實戰觀察

我在建這套系統的過程中,踩了不少坑,這邊跟大家分享幾個重要的觀察。

Google Drive 的資料夾結構設計是整個流程穩定運行的基礎。 我在影片一開始就強調了前處理:「我們必須要建立工作的資料夾,是做預處理的部分。」我在 Google Drive 裡建了四個子資料夾:音訊檔的存放區(根目錄)、逐字稿資料夾、字幕檔資料夾、和完成作業資料夾。這樣設計的目的是什麼?就像我在影片裡說的:「整個資料夾的構成是清楚明確,而且你很方便後面所有的作業,你知道發生什麼事的。」

檔案類型的篩選非常重要,不是什麼檔案都要處理。 我在流程裡加了一個 If 判斷:「確保只有處理音訊檔的部分,其他的檔案不要。我們只對 MP3 檔案進行後續的轉換。」如果你跳過這一步,萬一有人不小心上傳了一個 PDF 到同一個資料夾,整個流程就會出錯。

Whisper 轉錄出來的逐字稿,一定要再經過 AI 審稿。 這是我在影片裡花了很多時間示範的部分。Whisper 的準確率很高,但是轉錄出來的文字「標點符號不完整、格式不夠流暢」。所以我加了一個 OpenAI Review 的步驟,讓 ChatGPT 化身審稿人:「幫我們 review 文字的校對並且進行修正。」

老實說,Prompt 的設計就是整個審稿品質的關鍵。 我在影片裡展示了我的 Prompt:「你是繁體中文的智能助理,你的任務是修正轉錄文本中的拼字錯誤。」但很重要的是,我特別要求:「僅修正錯誤跟標點符號,不要改原本的內容。」因為逐字稿就是要忠於原始音檔,不能讓 AI 大改特改。

SRT 字幕檔在 Google Drive 裡面其實是 TXT 格式。 這個小細節很多人不知道。我在影片裡有特別提到:「雖然 SRT 是字幕檔案,但在 Google Drive 裡面它是 TXT 檔,要記得。」所以在上傳到 Google Drive 的時候,不用特別處理格式,直接當文字檔上傳就好。


完整建置步驟

好,接下來我帶你一步一步把這套系統建起來。我在影片裡把每個 Step 都講得很詳細,你跟著做就對了。

前置作業:建立 Google Drive 工作資料夾

在建立 n8n 工作流之前,你需要先在 Google Drive 建立資料夾結構。我在影片裡示範了這個步驟:

n8n-transcript/
├── (根目錄)         # 放 MP3 音訊檔,觸發自動化
├── 逐字稿/           # 存放轉錄後的 Google Docs 逐字稿文件
├── 字幕檔/           # 存放生成的 SRT 字幕檔
└── 完成作業/         # 處理完成的音檔移到這裡

我在影片中說明每個資料夾的用途:「音訊檔的資料夾存放原始的音訊檔案,例如 MP3 或者是 WAVE。逐字稿的資料夾存放轉換以後的逐字稿文件。字幕檔的資料夾存放 SRT 的字幕文件。最終完成作業的資料夾存放完成處理的檔案。」

這樣設計的好處是:「當音訊檔處理完畢以後,我們就會被移動到完成作業的資料夾,確保整個流程順利的執行。」不會搞混哪些已經處理、哪些還沒處理。

Step 0:Google Drive Trigger — 上傳音檔觸發自動化

這一步是整個流程的起點。當你把 MP3 音檔上傳到 Google Drive,系統就會自動偵測並觸發處理程序。

我在影片裡設定了兩個事件偵測:

事件一:File Created(新檔案建立)

  • 使用 Google Drive API 的 Created File 事件
  • 監控指定資料夾的 URL
  • 每五分鐘偵測一次(也可以調整成每分鐘)

事件二:File Updated(檔案變更)

  • 如果你重新上傳或覆蓋檔案,也會觸發事件
  • 確保修正版本的檔案也能自動被處理

我在影片裡解釋了為什麼需要兩個事件:「只要有新的音檔被建立,系統就會觸發事件。再來就是當檔案發生變更的時候,系統就會再次偵測最新版本,就會被納入處理的範圍。」

檔案類型篩選

觸發之後,我加了一個 If 節點來檢查檔案類型:「JSON FileExtension 是 MP3,確保只有處理音訊檔的部分,其他類型的檔案我們就不會處理。」

整個觸發機制總結:「MP3 上傳到 Google Drive 裡面,就會自動偵測並且觸發處理程序。當你把工作流打開的時候,它就會自動運行。」

Step 1:Whisper API — 音檔轉逐字稿

確認是 MP3 檔案之後,接下來就是用 OpenAI 的 Whisper API 做語音轉文字。

1.1 取得檔案屬性(Set File ID)

先用一個 Set 節點把檔案的三個屬性獨立出來:ID、mimeType、Name。我在影片裡解釋:「我們把這三個屬性獨立出來方便後續的使用。也就是說每個檔案都會有自己的身分證,我們根據這個身分證把它下載下來。」

1.2 下載音檔

Google Drive 節點,根據 File ID 下載音訊檔案。下載完成後就準備好進行轉錄了。

1.3 Whisper API 轉錄

用 n8n 的 OpenAI 節點,選擇 Transcribe a Recording 功能:

  • 把 MP3 檔案上傳到 Whisper API
  • Whisper 會把音訊內容轉換成文字
  • 輸出成 TXT 格式的逐字稿

我在影片裡說:「把音訊檔上傳到 OpenAI 的 API,利用 OpenAI 提供的 Transcribe a Recording 功能,把 MP3 檔案上傳到 Whisper API 進行轉錄。Whisper 會把音訊的內容轉換成文字並且輸出成 TXT 檔。」

Step 1.5:OpenAI Review — AI 審稿校對

這一步是整個流程品質提升的關鍵。我在影片裡花了很多時間說明為什麼需要這一步。

Whisper 轉錄出來的文字會有幾個問題:標點符號不完整、格式不夠流暢、偶爾有拼字錯誤。所以我用 ChatGPT 做第二層處理。

Prompt 設計:

你是繁體中文的智能助理,你的任務是修正轉錄文本中的拼字錯誤。

我在影片裡特別強調審稿的原則:

  • 調整格式跟標點符號(逗號、句號、換行)
  • 僅修正錯誤跟標點符號,不要改原本的內容
  • 確保轉錄的內容忠於原始的檔案,不要大改特改
  • 儘量以逐字稿為主

審稿完成後,左邊是原始逐字稿,右邊是修訂後的版本。我在影片裡驗證了結果:「審稿機器人會讓我們的輸出更為精確,更為格式 OK 的內容。」

Step 2:生成 Google 文件 — 儲存逐字稿

審稿完成後,把校對過的逐字稿存入 Google Docs 文件。

2.1 建立 Google Document

Google Docs 節點的 Create 操作:

  • 存放位置:指定 Google Drive 的逐字稿資料夾(用 Folder ID)
  • 檔案名稱:使用原始音檔名稱加上 Transcript 和時間戳。例如:EP1-1 AI 自動化 Demo - Transcript 2026-01-15

我在影片裡說:「我們會根據原始的音檔名稱,產生一個對應的 Google 文件,後面加一個 Transcript 或寫轉錄跟時間戳,方便你來管理跟辨識。」

2.2 寫入逐字稿內容

建立文件後,系統會回傳 Document ID。再用 Google Docs 節點把審稿後的內容寫入這份文件。

我在影片裡確認結果:「我們發現這個文件是逐字稿,內容正確。我們的逐字稿不僅被生成,而且它有做整理的動作。」最終你會得到「一個像 Word 一樣的逐字稿文件」。

Step 3:生成 SRT 字幕檔

如果你的音檔要用在影片上,就需要生成 SRT 格式的字幕。我在影片裡解釋了原因:「SRT 是最好的選擇,因為 SRT 裡面包含時間戳記,每個文字都會有特定的時間區段,會有字幕的效果。」

3.1 HTTP Request 呼叫 Whisper API

這一步用 HTTP Request 節點直接呼叫 OpenAI 的 Whisper API,跟 Step 1 不同的是,這次要求回傳 SRT 格式。

設定要點:

  • Method: POST
  • URL: api.openai.com/v1/audio/transcriptions
  • Header: Content-Type 設為 Multipart/Form-Data
  • Body (Form Data):
    • model: whisper-1
    • file: 使用 n8n 的 Binary File
    • response_format: srt(這是關鍵!)

我在影片裡有個很實在的提醒:「這個 Response Format 就是 API 要求的格式,其實在 OpenAI 的網站都有寫。那我相信大家是不會去看的,所以我幫你寫好了,直接使用就沒有問題。」

3.2 轉換成 TXT 檔案

API 回傳的 SRT 內容本質上是純文字。我用一個 Convert to File 節點把它轉成檔案:

  • Input/Output field: data
  • 檔案名稱: Subtitle.srt

我在影片裡說:「這邊沒有特別的需求,你就照著我這個來。」

3.3 上傳到 Google Drive

Google Drive 節點上傳到字幕檔資料夾:

  • Input data field: data
  • 檔案名稱: 原始音檔名稱 + Subtitle + 時間戳
  • 目標資料夾: 用 URL 指定字幕檔資料夾

上傳完成後可以到 Google Drive 確認。我在影片裡打開字幕檔驗證:「這邊其實就是單純的時間戳記搭配你的內容,字幕檔案的內容是 OK,可以搭配影片來做使用。」

Step 4:任務完成 — 移動到完成作業資料夾

最後一步是檔案管理。我在影片裡解釋了為什麼需要這一步:「要確保檔案能夠有效的管理,避免沒有處理和已完成的檔案混在一起,造成重複觸發或造成混亂。」

Google Drive 節點的 Move 功能:

  • 指定要移動的檔案 ID(最前面 Set File ID 取得的)
  • 目標資料夾:完成作業資料夾的 URL

移動完成後:「原始的工作資料夾理論上就會保持清空,未來就不會混在一起。所以最終就是把處理好的放進來,確保流程自動化管理。」


各方案比較

方案時間成本金錢成本準確率檔案管理適合對象
n8n + Whisper5 分鐘$0.18/影片95%+全自動歸檔定期產出的創作者
手動聽打3 小時$0100%手動管理偶爾需要的人
外包人力1 天$500-100095%需要溝通有預算的團隊
YouTube 自動字幕1 分鐘$080%無法管理不在意品質的人
Descript/Otter.ai10 分鐘$20/月90%平台內管理不想折騰的人

我的觀察是,n8n + Whisper 的最大優勢在於全自動化加上完整的檔案管理。就像我在影片裡設計的,所有的資料都集中在 Google Drive,你可以後續修改、管理、尋找過去做的紀錄。這是其他方案做不到的。


重點整理

  1. 前置作業:建立四個 Google Drive 子資料夾(根目錄、逐字稿、字幕檔、完成作業),這是整個流程穩定運行的基礎
  2. Google Drive Trigger 偵測兩種事件:File Created 和 File Updated,確保新檔案和修正版本都能被處理
  3. 檔案類型篩選必不可少:只處理 MP3 格式,其他類型的檔案不要觸發流程
  4. Whisper API 轉錄準確率高,但一定要加上 ChatGPT 審稿校對,修正標點符號和拼字錯誤
  5. 審稿 Prompt 的原則:僅修正錯誤,不要大改特改,忠於原始檔案
  6. SRT 生成的關鍵:在 HTTP Request 的 response_format 參數設為 srt,API 就會自動生成包含時間戳記的字幕
  7. 檔案歸檔策略:處理完成後用 Move 把音檔移到完成作業資料夾,保持工作區清空,避免重複觸發
  8. 所有資料集中 Google Drive:方便後續查看、編輯、管理,可以節省非常多時間

常見問題 FAQ

Whisper API 支援哪些音檔格式?檔案大小有限制嗎?

Whisper API 支援 MP3、MP4、M4A、WAV、WEBM 等常見音檔格式,檔案大小限制為 25MB。 我在影片裡用的是 MP3 格式,因為體積最小、相容性最好。如果你的檔案超過 25MB,建議先用 FFmpeg 降低位元率轉成 MP3。我在流程裡也有加檔案類型檢查:只對 MP3 或 WAV 格式進行後續轉換,其他類型不處理,避免出錯。

OpenAI Whisper 和 ChatGPT 的 API 費用大概多少?

Whisper API 每分鐘 $0.006 美金,ChatGPT 4o-Mini 的費用更低。以一支 30 分鐘的影片計算,整個流程(轉錄 + 審稿)大約只要 $0.20-0.30 美金,大概台幣 6-9 元。 如果你每月處理 20 支影片,總成本大約台幣 120-180 元。跟外包聽打(一支影片 $500-1000 台幣)或月訂閱的 SaaS 工具($20 美金/月)比起來,真的便宜太多了。

為什麼需要 ChatGPT 審稿?直接用 Whisper 的逐字稿不行嗎?

Whisper 轉錄的準確率很高,但輸出的文字通常缺少標點符號,而且格式不夠流暢。 我在影片裡特別示範了這個差異:左邊是 Whisper 第一次轉錄的原始內容,右邊是經過 ChatGPT 審稿後的版本。審稿會做幾件事:調整格式跟標點符號,修正偶爾的拼字錯誤,讓逐字稿更好讀。但我的原則是「不要大改特改,儘量以逐字稿為主」,確保忠於原始音檔的內容。

SRT 字幕檔可以直接上傳 YouTube 嗎?

完全可以。 YouTube 支援標準 SRT 格式,上傳後會自動解析時間軸和字幕內容。我在影片裡生成的 SRT 檔包含完整的時間戳記和對應文字,格式完全符合標準。要注意的一點是,就像我在影片裡提到的,SRT 在 Google Drive 裡面存的是 TXT 格式,但下載後改副檔名為 .srt 就可以直接使用。

這套系統除了影片字幕,還適合什麼場景?

我在影片裡提到兩大適用場景:企業內部的會議紀錄,以及線上課程的字幕製作。 會議紀錄的話,你只要把會議錄音的 MP3 上傳,就能自動產生有標點符號的逐字稿 Google 文件,方便團隊查看和編輯。線上課程的話,每堂課錄完直接上傳音檔,SRT 字幕和逐字稿一次搞定。逐字稿還能拿來改寫成部落格文章或社群貼文,一魚多吃。

可以同時處理多個音檔嗎?

可以,這也是用 Google Drive Trigger 的好處。 你一次上傳多個 MP3 檔案到資料夾,系統會按照偵測順序依序處理。我的 Trigger 設定是每五分鐘偵測一次,你也可以調成每分鐘。每個檔案處理完成後會自動移到完成作業資料夾,所以不會搞混。就像我在影片裡說的:「所有的資料都集中在 Google Drive,你可以後續修改,也可以管理去尋找過去做的紀錄。」


下一步行動

🎓 想更有系統地學會這些技巧?AI 職場工作術(雲端方程式 Cloud F1 旗艦課程) 看看完整的實作路徑。

如果你看完這篇想動手試試,我建議你按這個順序來:

  1. 先在 Google Drive 建好 n8n-transcript 資料夾和四個子資料夾
  2. 在 n8n 裡建立 Google Drive Trigger 節點,設定偵測 File Created 事件
  3. 設定好 OpenAI API Key
  4. 按照本文的步驟建立完整工作流
  5. 用一支短音檔(5 分鐘以內)測試整個流程
  6. 確認逐字稿和 SRT 都正確後,開啟 Workflow 讓它自動運行

就像我在影片最後說的:「免費的模板提供給大家,連結在下方文件敘述欄,只要下載 JSON 檔匯入就可以了。」

先求大概懂,再開始用,最後才能做成功!

想學更多 n8n 自動化技巧? 加入我們的 Skool 社群,和其他自動化愛好者一起學習交流!


相關資源


✍️ 關於作者:Alex 是一位專注於 n8n 自動化和 AI 應用的技術教育者,透過 YouTube 頻道和 Skool 社群幫助超過數千位學員掌握自動化技能。

想把這篇學到的用進日常工作?

「AI 職場工作術」課程把這類實戰經驗整理成一步步的教學,帶你系統化練出跟 AI 協作的產能。

看 AI 職場工作術課程 →

本文作者:Alex Hsieh,SRE / DevOps 背景出身,現為企業 AI 導入顧問,也是「AI 相談室」課程講師。專注把 AI 自動化真正落地到企業日常流程,而不是停留在 Demo。

目錄
  1. 專業導讀
  2. 你將學到
  3. 什麼是 n8n 字幕翻譯自動化?
  4. 為什麼需要字幕自動化?
  5. 效率對比
  6. Whisper API 費用極低
  7. Alex 的實戰觀察
  8. 完整建置步驟
  9. 前置作業:建立 Google Drive 工作資料夾
  10. Step 0:Google Drive Trigger — 上傳音檔觸發自動化
  11. Step 1:Whisper API — 音檔轉逐字稿
  12. Step 1.5:OpenAI Review — AI 審稿校對
  13. Step 2:生成 Google 文件 — 儲存逐字稿
  14. Step 3:生成 SRT 字幕檔
  15. Step 4:任務完成 — 移動到完成作業資料夾
  16. 各方案比較
  17. 重點整理
  18. 常見問題 FAQ
  19. Whisper API 支援哪些音檔格式?檔案大小有限制嗎?
  20. OpenAI Whisper 和 ChatGPT 的 API 費用大概多少?
  21. 為什麼需要 ChatGPT 審稿?直接用 Whisper 的逐字稿不行嗎?
  22. SRT 字幕檔可以直接上傳 YouTube 嗎?
  23. 這套系統除了影片字幕,還適合什麼場景?
  24. 可以同時處理多個音檔嗎?
  25. 下一步行動
  26. 相關資源