電商圖片 AI Agent|OpenAI GPT-image-1 + n8n 自動生成商品圖
更新於 2026年2月11日
📥 工作流 JSON 下載:GitHub 範例庫 | 💬 社群討論:Skool 雲端方程式 Cloud F1
專業導讀
來了!OpenAI Release 他們最新的 GPT-image-1,我們立刻來打造一下電商商品的圖片,建立靈感的來源。不囉嗦直接來!
你有沒有遇過這種情況?電商上架一個新商品,需要白底圖、情境圖、社群素材圖,光是跟設計師來回溝通就花了兩三天。如果商品有 10 個 SKU,每個要 3 種風格的圖,那就是 30 張圖 — 設計師大概要忙一整週。
重點來了 — 用 OpenAI 最新的 GPT-image-1 模型加上 n8n 的 AI Agent,你可以在 LINE 上面打一段商品描述,幾分鐘就拿到一組專業的商品圖。 我在影片裡面 Demo 了兩個範例:第一個是生成紅色洋裝商品圖,25-30 歲的亞洲女性在晴朗的海邊;第二個是帥氣的太陽眼鏡商品,歐洲男性的情境照。兩個都是在 LINE 裡面打指令,幾分鐘內就收到完成的圖片,而且自動同步到 Google Drive。
你將學到
- ✅ GPT-image-1 模型的特色、價格與實際效果評測
- ✅ n8n 電商圖片 AI Agent 的完整架構與設計邏輯
- ✅ 從零開始建置 LINE 整合一鍵生圖的步驟教學
- ✅ Prompt 工程技巧:讓 AI 產出商業可用的商品圖
- ✅ GPT-image-1 vs DALL-E 3 vs Midjourney 完整比較
🎯 什麼是電商圖片 AI Agent?
電商圖片 AI Agent 是一個結合 OpenAI GPT-image-1 圖片生成模型與 n8n 自動化工作流的智慧系統,讓使用者透過 LINE 傳送商品描述,就能自動生成多種風格的專業商品圖片,並同步儲存到 Google Drive。
讓我帶你看一下整個概念。傳統的電商商品圖製作流程是這樣的:商品經理寫需求 → 設計師理解需求 → 拍攝或 P 圖 → 來回修改 → 定稿。這個流程最快也要 1-2 天。
我在想,如果有一個 AI Agent 能直接理解商品描述,然後自動生成圖片呢?這就是我做這個 Lab 的出發點。
GPT-image-1 是什麼?
我在影片裡面用 30 秒快速介紹了 GPT-image-1。它是 OpenAI 在 2025 年推出的最新圖片生成模型,也就是 ChatGPT 裡面「生圖」功能背後的技術。跟之前的 DALL-E 3 比起來,它有幾個很明顯的進步:
- 原生多模態理解:可以根據文字產生高品質的圖片,它也已經整合到所有企業型的客戶裡面,包含 Figma 做擴充圖像、Adobe 整合到 Express 裡面
- 文字渲染超強:圖片裡的文字清晰可讀,這在商品圖上超重要(品牌名、價格標籤)
- 細節處理優秀:膚色、材質、光線的處理比 DALL-E 3 好很多
- 安全跟合規:你不可以請它產生色情圖片或色色的東西,它有講你不要搞這些有的沒的
- 商業可用:OpenAI 明確表示生成的圖片版權歸用戶所有
OpenAI Image API 的三種功能
我在影片裡面快速整理了重點,因為可能有些人沒有用過影像生成的 API。OpenAI 目前提供三個 Image 模型:GPT-image-1、DALL-E 3、DALL-E 2(這個可以隨便念,你念的順就好)。一般來講會有三種功能:
- 生成(Generation) — 從文字提示裡面生成新圖片。我跟它說今天要生成一個歐洲男性,它就生成了
- 編輯(Editing) — 編輯現有的圖片,就是你已經有圖了,請它幫你改。例如把四個商品元件放在一起變成一個完整的商品 Set
- 變體(Variations) — 產生現有圖片的變體,把同一個圖片生成不同的樣式。目前只有 DALL-E 2 支援這個功能
GPT-image-1 價格
這個價格我覺得非常合理,特別是對電商來說:
| 解析度 | 每張價格 (USD) | 每張約台幣 | 適合用途 |
|---|---|---|---|
| 1024x1024 | $0.04 | ~1.3 元 | 社群素材、縮圖 |
| 1792x1024 | $0.08 | ~2.6 元 | 商品主圖(橫式) |
| 1024x1792 | $0.08 | ~2.6 元 | 商品主圖(直式) |
你想想看,請設計師做一張商品圖大概要 500-2000 元台幣,AI 生成一張不到 3 元。就算 AI 生的圖只有 70% 可以直接用,剩下 30% 需要微調,整體成本還是降了 90% 以上。
💡 Alex 的實戰觀察
我自己從 DALL-E 2 的時代就開始用 AI 生圖了,到現在測試過的工具不下 10 種。讓我分享一些真實的觀察:
觀察 1:GPT-image-1 的品質跳了一大步
我在影片裡面拿同一個 Prompt 分別跑 DALL-E 2、DALL-E 3 和 GPT-image-1,差異真的是肉眼可見的。我個人覺得真的有差,品質上是有差異的。
我自己碎碎念體感上的比喻:Image-1 大概有 1024P、DALL-E 3 大概是 720P、DALL-E 2 大概是 360P。這個是我個人主觀意見沒有對錯,提供給大家參考。
Image-1 在細節背景上相對比較細緻,人物也比較真實。DALL-E 3 生成出來的細部內容是比較好的,但膚質的部分跟比較遠的部分,它的細節處理可能還是沒有那麼好。DALL-E 2 在圖片的深層跟邊緣的處理解析度,明顯就是有差。但這個是一個工具的演進,所以這也沒有對錯,就是再過半年會更強,再過一年可能就取代攝影師了。
我的經驗: 用 GPT-image-1 生成的白底商品圖,大概有 60-70% 可以直接用在電商平台上架。剩下的通常只需要微調構圖或背景,不用整張重做。可能離真正的商業級還有點差距,但是已經會有人開始部分的導入了。
觀察 2:Prompt 設計是關鍵中的關鍵
這邊要特別注意 — 很多人覺得 AI 生圖就是打幾個字它就會給你好圖。我的觀察是,Prompt 的品質決定了 80% 的結果。好的商品圖 Prompt 需要包含:
- 場景描述:白底攝影、生活情境、模特展示
- 風格指定:專業攝影風、雜誌風、韓系清新風
- 光線描述:柔和自然光、影棚燈光、背光效果
- 構圖指令:正面平拍、45 度角、特寫
- 品質關鍵字:high quality, professional product photography, 8K
觀察 3:不是所有商品都適合,但「靈感來源」超好用
我要誠實說,AI 生圖目前還有一些限制。但我在影片裡面強調的是,這個系統最大的價值是建立靈感的來源。你可以看一下各大電商的網站,都會有類似的模特兒圖。很可怕,其實現在都可以不需要模特兒了,直接用生成的方式就可以做商品的展示圖。甚至你可以拍很多個,還可以調整成不同的環境。
效果好的商品類型:
- 3C 配件、手機殼(簡單造型,白底效果好)
- 服飾配件(飾品、包包、帽子、太陽眼鏡)
- 食品包裝(外包裝圖,不是食物本身)
- 家居用品(杯子、擺飾、文具)
效果一般的商品類型:
- 食物實拍(AI 生的食物還是有種「不真實感」)
- 需要精確比例的商品(尺寸不太準)
- 已有品牌 Logo 的商品(Logo 還原度有限)
我覺得最好的策略是:用 AI 生成初版 + 人工微調,而不是完全依賴 AI。你可以利用這個來產生你電商商品的靈感,去想今天可能需要產生什麼樣的圖片、什麼樣的風格是最適合你的。
🔧 n8n 電商圖片 AI Agent 完整架構與步驟教學
好,再來就是大家最期待的實作部分。我把整個 AI Agent 的架構拆解給你看。
整體架構
使用者 (LINE) → Webhook → AI Agent → GPT-image-1 → Google Drive → LINE 回傳
│
┌──────┴──────┐
│ Prompt │
│ Optimizer │
└─────────────┘
步驟 1:建立 LINE Webhook 接收節點
首先,你需要一個 LINE Messaging API 的 Channel。如果你還沒有,到 LINE Developers Console 申請一個。
在 n8n 裡面:
- 新增一個 Webhook 節點
- 設定路徑,例如
/line-image-agent - 把 Webhook URL 貼到 LINE Channel 的 Webhook URL 設定
步驟 2:建立 AI Agent 節點(Prompt 優化器)
這是整個系統的核心。我在影片裡面解說了,這個 AI Agent 它只專注做一件事:從左邊拿到的訊息,到右邊生成正確的提示詞。它的任務就這麼簡單。
AI Agent 不是直接把使用者的文字丟給 GPT-image-1,而是先「優化」Prompt。為什麼?因為你可能只說「幫我生成一張手機殼的圖」,但好的圖片需要更具體的描述。而且因為英文的比較準,會給的比較好,所以 AI Agent 會幫你把中文需求轉成英文 Prompt。
我在影片裡面展示了四個主要的元件:LLM 用什麼、它的記憶、Think Tool、以及結構化輸出。
System Prompt 範例:
你是一個業務分析師,產生電商的圖片跟商品敘述幫助銷售。
你的任務是接收內部的 Prompt,根據收到的 Prompt 調用 API 來生成。
輸出格式:商品的提示詞 Prompt + 幾個 Image(預設一個)。
Think Tool 的關鍵角色: 我在這裡的設計比較特別。上面的 AI Agent 是專注在「我要做什麼任務、輸入是什麼、輸出是什麼」,而 Think Tool 專注的是在商業邏輯 — 商品資訊的整理分析優化。我會請它知道商品種類、模特兒的特徵、背景的環境等等,因為每個產業要的東西不一樣,所以我專注在電商的商業邏輯,商品的圖片應該要有哪些東西。然後最後把資訊整理成英文的 Prompt,加入品質的敘述,盡量確保提示詞是自然的。
步驟 3:呼叫 GPT-image-1 API 生成圖片
這邊我在影片裡解釋了,因為 DALL-E 2、DALL-E 3 和 GPT-image-1 對於 API 的要求形式不一樣,裡面的參數不一樣,所以我需要先判斷 Model 是屬於哪個 Model。如果是 GPT-image-1 就走上面的路徑,不是就走下面。非常簡單。
用 n8n 的 HTTP Request 節點呼叫 OpenAI Images API:
{
"model": "gpt-image-1",
"prompt": "{{ 上一步 AI Agent 優化後的英文 Prompt }}",
"n": 1,
"size": "1792x1024",
"quality": "high"
}
這邊的認證可以用 Predefined,就是你可以選 OpenAI 的類型,如果你已經有打好 OpenAI 的 API 權杖,可以直接用 Predefined,也可以自己輸入。
注意: 這個 API 大概需要 30 秒左右,每個人的體感等級不一樣。另外,這個版本的 GPT-image-1 它只會給你 Base64 的 JSON 格式 — 就是圖片是一堆亂碼的編碼格式。我就把它輸出成一個 PNG 檔,變成一個圖片了,這樣就搞定。
步驟 4:自動上傳到 Google Drive
生成的圖片從 Base64 轉換成 PNG 後,上傳到 Google Drive:
- 新增 Google Drive 節點
- 操作選擇「Upload File」
- 設定目標資料夾(建議按日期 + 商品分類)
- 檔名格式:
{商品名}_{風格}_{日期}.png
步驟 5:回傳圖片到 LINE
用 LINE 節點回傳圖片訊息:
- 取得 Google Drive 的分享連結
- 用 LINE 的 Image Message 格式回傳
- 加上操作按鈕(重新生成、換風格、下載原圖)
步驟 6:進階 — 多風格批次生成
如果你想一次生成多種風格的圖片,可以加一個 Loop 節點:
風格清單: ["白底攝影", "生活情境", "雜誌風格"]
↓
For Each 風格:
→ AI Agent 優化 Prompt(加入風格描述)
→ GPT-image-1 生成圖片
→ Google Drive 存儲
↓
合併所有圖片 → LINE 回傳圖片組
我自己在用的時候,通常一個商品會生成 3 種風格:白底(上架用)、情境(社群用)、特寫(商品詳情頁用)。
📊 GPT-image-1 vs DALL-E 3 vs Midjourney 完整比較
很多人問我到底要用哪個工具生商品圖?讓我用實際使用經驗做一個完整比較:
| 比較項目 | GPT-image-1 | DALL-E 3 | Midjourney v6 |
|---|---|---|---|
| 文字渲染 | ⭐⭐⭐⭐⭐ 優秀 | ⭐⭐⭐ 普通 | ⭐⭐ 較差 |
| 商品真實感 | ⭐⭐⭐⭐⭐ 極佳 | ⭐⭐⭐ 尚可 | ⭐⭐⭐⭐ 好 |
| 藝術風格 | ⭐⭐⭐⭐ 好 | ⭐⭐⭐⭐ 好 | ⭐⭐⭐⭐⭐ 最強 |
| API 整合 | ⭐⭐⭐⭐⭐ 有 API | ⭐⭐⭐⭐⭐ 有 API | ⭐⭐ 無官方 API |
| 價格(每張) | $0.04-0.08 | $0.04-0.08 | $10/月(約 200 張) |
| 白底商品圖 | ⭐⭐⭐⭐⭐ 最佳 | ⭐⭐⭐ 普通 | ⭐⭐⭐⭐ 好 |
| n8n 自動化 | ⭐⭐⭐⭐⭐ 完美 | ⭐⭐⭐⭐⭐ 完美 | ⭐ 困難 |
| 中文 Prompt | ⭐⭐⭐⭐ 好 | ⭐⭐⭐ 普通 | ⭐⭐⭐ 普通 |
| 適合場景 | 電商商品圖 | 通用插圖 | 藝術創作 |
我的選擇建議
- 電商商品圖(白底、情境) → GPT-image-1,文字渲染和真實感最好
- 社群素材(藝術風格) → Midjourney,藝術風格無敵
- 通用配圖(部落格、簡報) → DALL-E 3,便宜好用
- 需要自動化 → GPT-image-1 或 DALL-E 3,有 API 可以串
我自己的做法是:電商用 GPT-image-1 + n8n 自動化,社群素材偶爾用 Midjourney 手動生。
💡 Prompt 工程實戰技巧
這一段我特別想跟大家分享,因為我踩過很多坑。
電商商品圖 Prompt 公式
我整理了一個萬用公式:
[商品名稱] + [材質/顏色] + [場景] + [光線] + [構圖] + [風格] + [品質]
範例 1:白底商品圖
A minimalist white ceramic coffee mug on a pure white background,
soft studio lighting, front-facing product photography,
clean and professional, high resolution 8K, commercial product photo
範例 2:生活情境圖
A cozy lifestyle shot of a white ceramic coffee mug on a wooden table,
morning sunlight streaming through a window, steam rising from the cup,
magazine editorial style, warm tones, shallow depth of field
範例 3:社群素材圖
Flat lay composition of a white ceramic coffee mug surrounded by
autumn leaves and a book, top-down view, natural lighting,
Instagram aesthetic, pastel color palette, clean composition
我踩過的坑
- 不要用中文 Prompt:雖然 GPT-image-1 支援中文,但英文的效果明顯更好
- 不要描述太多元素:一張圖不要超過 3 個主要元素,不然會很亂
- 明確指定「不要什麼」:加上 negative prompt 概念,例如 “no text, no watermark”
- 品質關鍵字放最後:
8K, high quality, professional放在 Prompt 結尾效果最好
Gemini + OpenAI 雙模型策略
我在進階版的 Agent 裡面用了一個技巧 — 雙模型策略:
Google Gemini 負責:
- 分析使用者的商品描述
- 補充遺漏的視覺細節
- 生成優化後的英文 Prompt
OpenAI GPT-image-1 負責:
- 接收優化後的 Prompt
- 生成高品質商品圖片
為什麼要這樣做?因為 Gemini 的文字理解能力很強,拿來做 Prompt 優化很適合。而 GPT-image-1 的圖片生成品質最好。把兩個模型的長處結合起來,出圖的品質比單一模型好很多。
在 n8n 裡面,你可以用 AI Agent 節點設定 Fallback 機制:如果 Gemini API 回應太慢或出錯,自動切換到 GPT-4o 做 Prompt 優化。這樣系統的穩定性更高。
重點整理
- GPT-image-1 是目前電商商品圖最佳選擇:文字渲染、真實感、API 整合三個維度都最強
- 成本極低:每張圖 1-3 元台幣,比傳統設計省 90% 以上
- n8n + LINE 整合:用戶只要在 LINE 傳商品描述,幾分鐘就拿到專業商品圖
- Prompt 設計決定 80% 的品質:場景 + 光線 + 構圖 + 風格 + 品質關鍵字缺一不可
- 雙模型策略更強:Gemini 優化 Prompt + GPT-image-1 生成圖片,效果最好
- 不是所有商品都適合:食物實拍、精確比例商品目前效果還有限
- AI 生圖 + 人工微調:最佳實踐是 AI 生成初版,人工做最後調整
常見問題 FAQ
GPT-image-1 和 DALL-E 3 差在哪?什麼情況該用哪個?
A: 我兩個都測試過很多次了。最大的差異在「文字渲染」和「商品真實感」。GPT-image-1 生成的圖片裡,如果有品牌名稱或價格標籤,文字是清晰可讀的;DALL-E 3 的文字常常會糊掉。另外 GPT-image-1 的商品看起來更像「真的拍出來的」,DALL-E 3 有時候會有一種明顯的 AI 感。我的建議是:電商商品圖一律用 GPT-image-1,部落格配圖或簡報插圖用 DALL-E 3 就夠了。
生成的圖片真的可以商用嗎?有什麼法律風險?
A: 可以商用。OpenAI 的使用條款明確表示,用戶透過 API 生成的圖片,版權歸用戶所有,可用於商業目的。但我建議注意幾點:
- 不要生成涉及真人肖像的圖(可能有肖像權問題)
- 不要模仿特定品牌的視覺風格(可能有商標侵權風險)
- 建議加上自己的品牌標識(浮水印或 Logo)
- 保留生成記錄(萬一有爭議,有 API 呼叫紀錄可以佐證)
我自己在商業用途上都會再做一層人工審核,確認沒有問題才上架。
如何提高生成圖片的品質?有什麼 Prompt 技巧?
A: 這是我被問最多的問題。我整理了幾個實測有效的技巧:
- 用英文寫 Prompt:效果比中文好 30% 以上
- 具體描述場景:不要只說「商品圖」,要說「white background, studio lighting, front view」
- 加入風格參考:「magazine editorial style」或「Amazon product listing style」
- 指定不要的東西:「no text, no watermark, no human hands」
- 品質關鍵字:最後加上「8K, ultra high resolution, professional product photography」
- 用 AI Agent 優化:讓 Gemini 或 GPT-4o 先幫你把 Prompt 寫得更專業
電商圖片 AI Agent 的完整工作流怎麼設計?
A: 我的完整工作流設計是這樣的:
- LINE Webhook 接收商品描述(支援文字 + 圖片)
- AI Agent 分析商品描述,優化成英文 Prompt(加入電商風格關鍵字)
- GPT-image-1 生成圖片(size: 1792x1024)
- Image Processing(可選):裁切、加浮水印、調整尺寸
- Google Drive 同步儲存(按日期 + 商品分類建資料夾)
- LINE Reply 回傳圖片 + 操作按鈕(重新生成、換風格)
整個工作流在 n8n 裡面大概 8-10 個節點,第一次設定花 1-2 小時,之後就是全自動的。
如何使用 OpenAI 和 Gemini 雙模型?會不會很複雜?
A: 其實不會複雜。在 n8n 裡面就是兩個 AI 節點串在一起:
- 第一個 AI 節點(Gemini):接收使用者的中文商品描述 → 輸出優化後的英文 Prompt
- 第二個節點(HTTP Request):拿 Prompt 呼叫 GPT-image-1 API → 拿到生成的圖片
你也可以在 AI Agent 裡面設定 Fallback:如果 Gemini 掛了,自動切換到 GPT-4o 做 Prompt 優化。這樣系統的穩定性更高。我自己用了三個月,基本上沒出過什麼問題。
一個月大概要花多少錢?適合小電商嗎?
A: 我來算給你看。假設你一個月上架 50 個新商品,每個商品需要 3 種風格的圖(白底 + 情境 + 特寫):
- 圖片數量:50 × 3 = 150 張
- 每張成本:$0.08(用 1792x1024)
- GPT-image-1 費用:150 × $0.08 = $12/月(約 384 台幣)
- Gemini API 費用:幾乎免費(免費額度夠用)
- n8n 費用:自架免費,雲端版 $20/月起
總成本大約 400-1,000 台幣/月,比請一個兼職設計師便宜太多了。非常適合小電商。
🎯 下一步行動
🎓 想更有系統地學會這些技巧? 到 AI 職場工作術(雲端方程式 Cloud F1 旗艦課程) 看看完整的實作路徑。
如果你想動手做一個自己的電商圖片 AI Agent,我建議的路徑是:
- 看影片:先看我的 YouTube 完整教學,了解整體架構
- 申請 API:到 OpenAI Platform 申請 GPT-image-1 API Key
- 建工作流:在 n8n 裡面按照我上面的步驟,先建一個最簡單的版本
- 優化 Prompt:用我分享的 Prompt 公式,反覆測試找到最適合你商品的描述方式
- 加入社群:到 Skool 社群 跟大家分享你的成果
🚀 想學更多 n8n 自動化技巧? 加入我們的 Skool 社群,和其他自動化愛好者一起學習交流!
🔗 AI Agent 系列文章
- AI Agent 完整指南 - Pillar 頁面
- xAI Grok AI Agent 教學 - Grok 整合
- 5 種 AI API 比較 - 選擇最適合的 API
- 購物搜尋 AI Agent - 電商搜尋應用
- 語音 AI Agent - 語音互動
- OpenAI Agent Builder - 官方 Agent 工具
🔗 相關資源
- 📺 YouTube 完整教學 EP19 - 影片版本
- 💬 Skool 雲端方程式 Cloud F1 社群 - 和 500+ 學員交流
- 🔗 OpenAI Images API 文件 - 官方 API 文檔
- 🔗 n8n 官方文件 - n8n 使用指南
- 📖 LINE Messaging API 教學 - LINE 整合基礎
- 📖 n8n 零基礎教學 - n8n 入門
🚀 想學更多 n8n 自動化技巧? 加入我們的 Skool 社群,和其他自動化愛好者一起學習交流!
✍️ 關於作者:Alex 是一位專注於 n8n 自動化和 AI 應用的技術教育者,透過 YouTube 頻道和 Skool 社群幫助超過數千位學員掌握自動化技能。