第 17 章

影片管線:從腳本到 YouTube 可上傳

你有想拍的東西——家電開箱、家事教學、儀表板 demo——但一想到剪片就頭痛?Pi Agent 內建一條叫 pitch_video 的管線,把 AI 寫腳本、機器配音、瀏覽器錄畫面、剪接、燒字幕、上傳雲端全部串起來。你只出想法,成品直接是能上 YouTube 或丟 Line 群的 MP4。這章先講清楚整條管線在做什麼、什麼場合適合用、什麼場合會踢鐵板;第 18 章講首次啟動要下載的 720 MB 是什麼,第 19 章講怎麼設定 Google Drive 自動上傳。

為什麼要用這條影片管線

先講一個很現實的痛點:你有想分享的東西,但影片沒人看你不會做

家裡買了一台新的掃地機器人,你想拍個開箱給朋友或 Line 群分享——但你要剪片、要配音、要打字幕,光學 CapCut 就先勸退你三小時。想錄一段「HA 儀表板一鍵離家自動化」給老爸看,你要一邊操作、一邊講、一邊怕手抖,錄五次都不順。想給小孩錄一支「怎麼用平板控制客廳燈」的教學,字幕還要自己聽打——直接放棄。

Pi Agent 內建的影片管線(video pipeline)就是為這個痛點設計的——底層工具(ffmpeg、Playwright-Chromium、edge-tts、rclone)由 add-on 內建,實際「把它們串起來」是靠一支 skill 出面(社群通稱 pitch_video 或 pi-video 這類名字,實際 slug 依你安裝的版本為準——見第 15 章)。你只要用白話跟 AI 講「我要什麼樣的影片、多長、給誰看」,管線背後會依序做這些事:

  • AI 幫你寫腳本——分成開場、主體、收尾,每一段幾秒都算好。
  • 免費 TTS 幫你配音——用微軟的 edge-tts 引擎,繁中男聲女聲都有,念得很自然。
  • Playwright 幫你錄畫面——它會開一個看不見的瀏覽器,照腳本一步步操作、一步步截影格。
  • ffmpeg 幫你剪接——把畫面、配音、字幕合起來,加轉場。
  • rclone 幫你上傳——完成後直接推到你指定的 Google Drive 資料夾,手機開就能看。

整條管線全部在你自己的 HA 主機上跑,不用另外開電腦、不用付訂閱、不用學新軟體。你的工作只有兩件事:想清楚要做什麼、看成品滿不滿意。剩下都是 AI 跟工具的事。

觀念:這條管線不是要取代專業 YouTuber——他們拍的是有溫度的真人影像。這條管線是幫你做「日常說明用」的影片:3 到 5 分鐘、有語音有字幕、能傳能收藏就好。像家庭主婦寫食譜、學長寫筆記,重點是「有」,不是「精緻到得獎」。

這條管線背後到底做了什麼(六個步驟)

要用得順,先看清楚它在做什麼。把它想成一條工廠的生產線,六個工人接力做完你就拿到成品:

步驟做的事用的工具(技術名)大約要多久(3 分鐘影片)
1. 寫腳本 AI 讀你的需求,分段寫出旁白、決定每段幾秒、需要展示哪個畫面 你在第 5、11 章接的那家 AI(推薦 reasoning 模型) 30 秒~1 分鐘(含你回覆確認)
2. 產生配音 把腳本每段丟給文字轉語音(Text-to-Speech, TTS),輸出 WAV/MP3 檔 edge-tts(微軟 Edge 瀏覽器的免費 TTS 引擎) 10-30 秒
3. 錄畫面 照腳本開一個「無頭」瀏覽器(headless browser),一步步操作並錄下畫面 Playwright + Chromium 1-3 分鐘(照著錄同長度的影片)
4. 對齊字幕 依配音的每字時間戳(word boundary)產生 SRT 字幕檔(每一行對應到幾秒到幾秒) edge-tts 的 SubMaker(word boundary event → SRT) 幾秒
5. 剪接與燒字幕 把畫面 + 配音 + 字幕合成一支 MP4,段落間加轉場(淡入淡出) ffmpeg(含 libass 字幕引擎、xfade 轉場濾鏡) 30 秒~2 分鐘
6. 上傳雲端 把成品 MP4 傳到你指定的 Google Drive 資料夾,手機 App 就能直接看 rclone(雲端硬碟同步工具) 依你上行網速,通常 30 秒-3 分鐘

加起來一支 3 分鐘的影片,從你按下「開始」到 Google Drive 收到,大約 5 到 10 分鐘。你可以在旁邊喝咖啡、洗碗、追劇——管線在 HA 主機裡靜靜跑,不佔你的手機也不佔你的電腦。

省時提示:第一次用會覺得「等 10 分鐘幹嘛不自己剪」,但你自己剪 3 分鐘影片沒兩小時搞不定;等你跑第五、六支影片,你會發現「講一句話就走」這件事有多爽——你可以一個下午做出七、八支影片,每支給不同人看。

為什麼首次啟動要下載 720 MB

你可能已經注意到,Pi Agent 剛裝完(第 2 章)只有幾十 MB。但當你第一次啟動 add-on,它會在背景下載大約 600-720 MB 的東西——這對用 100M 家用網路的人大概是 1-2 分鐘的事,對用 4G 熱點的可能就有感了。先把一個常見誤解講清楚:這 720 MB 不是觸發影片管線才下載,而是 add-on 首次啟動 video-tools-init 就會在背景抓;且這 720 MB 也不是整條管線的全部工具,是「下載到 /data/pi-agent/ 這顆 volume 的那一半」。另一半(ffmpeg、libass、字型、rclone)早就烤進 add-on 的容器映像檔裡,你「下載映像檔」那 300 MB 就順便拉下來了。

下載到 volume 的東西用來做什麼大約大小
Chromium 瀏覽器(Playwright 版) Playwright 拿來錄畫面;它需要一個「跑起來但看不到視窗」的瀏覽器。這一塊佔絕大多數。 約 500-600 MB
Python venv + 4 個套件 虛擬環境加上 playwright(Python 端控制程式)、edge-tts(TTS 配音)、pyyaml(讀腳本檔)、mutagen(讀音檔長度) 約 40-60 MB

合計就是常聽到的「約 720 MB」——實際落在 600-720 MB 之間,看 Playwright 版本跟 pip 依賴而定。底下這些不會另外下載,它們是映像檔的一部分

已烤進映像檔的工具用來做什麼
ffmpeg + libass剪接、加 xfade 轉場、燒字幕的核心工具
fonts-noto-cjk / fonts-noto-color-emoji / fontconfig字幕燒錄時繁中不變豆腐、彩色 emoji 能顯示
rclone推到 Google Drive、Dropbox、OneDrive 等雲端

「未安裝 pi-agent 就永遠不佔這 720 MB」——這句話成立;但一旦你啟動了 add-on,即使不做影片這 720 MB 也會下載到 volume(目前沒有「純聊天模式」開關)。詳情第 18 章講。

注意:首次啟動的下載細節(觸發時機、進度提示、失敗怎麼辦、要不要重來)第 18 章專章講。這章你只要知道「有這回事、佔 600-720 MB、下一次就不用再下」就好。

哪些場景很適合用這條管線

把管線的能耐配到具體家庭情境上,你會發現用途比你想像多。整理成一張表:

場景典型長度怎麼跟 AI 說成品傳給誰
家電開箱 60-120 秒 「幫我做一支 90 秒的影片介紹我家新買的掃地機器人,講重點功能、跟舊款比較」 Line 家庭群組、朋友、社群
家事教學(給小孩/長輩) 60-180 秒 「用小學生能懂的話,講怎麼分類回收,包括紙、塑膠、鐵鋁罐、廚餘」 家庭群、小孩的班親會、爺爺奶奶的 Line
HA 自動化 demo 60-180 秒 「錄我 HA 儀表板上『離家模式』按下去之後的效果,配旁白解釋做了什麼」 家人、HA 社群、部落格
產品試用心得 90-240 秒 「幫我把我試用某某 App 兩週的心得剪成影片,講三個優點兩個缺點」 YouTube、Facebook、Threads
給小孩看的教學 60-120 秒 「用 10 歲小孩能懂的話講什麼是『太陽能發電』,配可愛的旁白」 家庭裝置、學校作業
Line 群組短分享 30-60 秒 「30 秒告訴大家颱風天要準備什麼」 Line 群(Line 上要有字幕才有人看)
食譜示範 60-180 秒 「三分鐘教怎麼做涼拌小黃瓜,材料、步驟、注意事項」 家庭群、部落格
行事曆/活動預告 15-45 秒 「20 秒預告週末家庭日程,配輕鬆音樂感」 Line、行事曆分享

共同特徵:都是「以說明為主、真人露臉為輔」的短片。不需要你自己出鏡、不需要複雜運鏡、不需要昂貴設備——AI 的長處就是把「知識」變成「有語音+畫面+字幕」的形式,這比純文字好懂太多、比自己剪片省時太多。

心智模型:把它想成「AI 版的 PPT 加旁白」。PPT 本來就是把想法變成一頁一頁畫面加解說,這條管線就是「一次到位、附字幕、能傳」的 PPT。

哪些場景這條管線不擅長(也直接講)

沒有工具是萬能的。以下這幾種需求你別硬套 pitch_video,會做出來很尷尬的東西:

不適合的場景為什麼替代做法
需要真人露臉演出 Playwright 只會操作瀏覽器、只會截電腦畫面。它拍不到你本人,AI 也還沒到能生成逼真真人影像的程度(能生但很違和) 用手機拍完後傳給剪輯 App(CapCut);或用管線做「配音+畫面」搭配你自己手機拍的片段
要有無版權背景音樂 管線本身不處理背景音樂,只放旁白。你自己去 YouTube Audio Library 找的音樂要另外加 成品出來後用 CapCut 或 iMovie 加背景音樂,或改 pitch_video skill 的 ffmpeg 參數塞一軌音樂
超過 10 分鐘的長片 Playwright 錄很久很吃 CPU、edge-tts 生 10 分鐘配音要幾分鐘、ffmpeg 合成大檔要更久——時間會拖到很久 拆成 5 分鐘以內的多集;長片建議用真的剪輯軟體做
要複雜運鏡、特效、切換 管線的畫面全部來自 Playwright 錄瀏覽器,沒有推拉搖移、沒有轉場特效(只有基本 xfade 淡入淡出) 需要電影感的短片,用 CapCut、Premiere、DaVinci Resolve
需要即時直播 這條是「批次產生」管線,不是直播。做一支要等 5-10 分鐘 直播用 OBS 或手機直播 App,跟這條管線無關
版權敏感內容 AI 寫的腳本可能引用你來源的資訊、配音是機器合成的;商業用途或散播需注意版權與 AI 揭露 商用一律先確認:資料來源合法、AI 生成內容有標示、TTS 商用授權(edge-tts 個人用免費,商用要看微軟條款)
誠實原則(把 YouTube 規則講清楚):YouTube 2024 起的 Altered / Synthetic content 揭露規則,強制揭露的其實是「會讓觀眾誤以為是真實事件」的內容——像換臉、把真人聲音合成成他沒講過的話、竄改真實事件的畫面。YouTube 明確把「AI 幫你寫腳本、自動字幕、寫大綱」這類生產力用途排除在強制揭露之外;純機器 TTS 配自己的 dashboard 畫面通常也不落在強制揭露範圍。但這不代表可以隱瞞——TikTok / Meta(Facebook、Threads / Instagram)的規則不同,且觀眾看得出來就是看得出來。建議做法:影片描述加一句「本影片旁白由 AI 語音(Microsoft edge-tts)生成、腳本由 AI 協助撰寫」,一秒鐘寫完,各平台通吃、不會被判違規也不用擔心誤導。

動手:跑你第一支影片

假設你三個前置作業(第 18 章的首次啟動下載、第 19 章的 rclone Google Drive、第 15 章的 pitch_video skill 安裝)都做完了,跑一支影片是這樣的:

  1. 開一個新 session、挑一家會思考的 AI

    回到 Pi Agent 主畫面,按左上角「新對話」開新 session(第 8 章)。模型下拉挑 reasoning 模型——推薦 GLM-4.6、Anthropic Claude Sonnet、DeepSeek-R1 這幾家。不要用最便宜的打底模型,因為腳本品質決定影片品質,這裡值得多花一點。為什麼要用 reasoning 模型?第 12 章講過:它會先想再說,寫出來的腳本結構會清楚很多。

  2. 用白話說清楚你要什麼影片

    直接對話框打就好,範例:「幫我做一支 90 秒的影片,介紹我家的智慧插座能省多少電費,用一般家庭 3 人的用電量估算,語氣輕鬆一點,給爸媽看的」。四個要素要講清楚:(1)長度、(2)主題、(3)語氣、(4)目標觀眾。你講得越具體,AI 產出的腳本就越接近你想要的。

  3. 看 AI 給你的大綱,覺得不對就再改

    AI 不會直接開始做,會先給你一份大綱與腳本草稿——例如「開場 10 秒講痛點、主體 60 秒分三段講省電、收尾 20 秒 CTA」。這時你要認真看:段落順序對嗎?語氣像你嗎?有沒有講到你不想要的東西?直接回話「第二段改成 XX」「開場太長,縮到 5 秒」,AI 會改。這一步反覆幾次都很正常,比後面成品出來不對再重來省時間多了。

  4. 確認後 AI 呼叫 pitch_video skill

    你回「好,就這個腳本」之後,AI 會呼叫 pitch_video skill(你在第 15 章裝的)。你會看到對話裡出現一張工具卡片第 9 章介紹過),寫著它在做什麼:正在產生配音、正在錄畫面、正在剪接。這時候你可以離開視窗做別的事——它不會因為你不看就停。

  5. 幾分鐘後成品出現

    如果你設好了 Google Drive 上傳(第 19 章),你手機的 Google Drive App 會收到通知,成品 MP4 就在指定資料夾裡。如果你沒設 Google Drive,成品會存在 HA 主機的 /data/pi-agent/projects/<專案名>/——可以用檔案總管 add-on(Samba 或 File Editor)下載。

  6. 不滿意就講「再一版」

    成品出來你發現「配音太快」「字幕位置怪」「這段可以更短」——就在同一個 session 直接講:「重做一版,配音慢一點、開場刪掉」。AI 會用同一份腳本改參數重跑;連腳本都不喜歡就講「腳本重寫一次,改成 XXX 風格」,整條管線會從頭跑一次。不用你自己去改設定檔,都在對話裡完成。

觀念:整個流程叫「對話式剪片(chat-based video editing)」——你完全不用開剪輯軟體,全部靠跟 AI 講話。這是 pi-agent 生態最貼近未來工作方式的一段,值得多練幾次。

成品跟中間檔案放在哪、可以拿來幹嘛

管線跑完不只給你一支 MP4,還會留下一堆中間檔案——這些是你的資產,之後可以編輯、可以再剪、可以獨立用。全部放在 /data/pi-agent/projects/<專案名>/ 底下(projects/ 目錄由 add-on 首次啟動時建立,這一點可以直接進 File editor 驗證)。以下的檔名與副檔名是社群 pitch_video skill 的典型佈局webm/wav/srt 等副檔名跟 Playwright、edge-tts、ffmpeg 的預設輸出一致);你裝到的版本、或改過設定,可能略有不同——實際以你資料夾裡看到的為準:

檔案是什麼能拿來做什麼
final.mp4 成品:畫面+配音+字幕合體 直接上傳 YouTube、Line、Facebook;就是你要的東西
subtitles.srt 字幕檔(有時間軸的純文字) 另外上傳到 YouTube 當「多語字幕」;或用 Google 翻譯翻英文版變雙語
script.md AI 幫你寫的原始腳本(Markdown 格式) 編輯它可以重跑一次;也可以直接拿去發部落格文
voice/*.wav 每一段的配音音軌(分段存) 單獨拿來做 Podcast、放進其他影片、或當手機鈴聲
clips/*.webm Playwright 錄下的每段畫面(分段存) 重新配一段不同的旁白、或拿其中一段做 GIF
segments/*.mp4 合過配音+字幕的每段成品 抽出其中一段獨立分享(不用整支才有價值)
project.json 整個專案的設定、參數紀錄 之後用同一組參數做另一支類似風格的影片

檔案結構的意義:你不是被鎖在「成品或全部重來」兩個選項裡。腳本不喜歡,改 script.md 重跑;配音想換聲音,刪 voice/ 重跑;只想抽一段用,去 segments/ 拿。這叫「可組合(composable)」——每一步都留檔,你可以中間插手。

注意:備份(第 2 章提過的 HA 備份機制)預設不會clips/segments/voice/ 這些大檔備進去(管線輸出可能很大,塞爆備份就慘了)。備份會保留 final.mp4script.mdsubtitles.srtproject.json 這些關鍵小檔。想保留全部就自己另外抄一份到 NAS。

要能跑通,三個前置作業一定要做完

剛入門的人最常見的挫折:「我對 AI 講『幫我做影片』,它說沒辦法」——十之八九是這三個前置沒做完。列出來對照:

前置做這件事的章節沒做的症狀做完的檢查方式
裝好 pitch_video skill 第 14 講概念、第 15 章教安裝 AI 說「我沒有能幫你做影片的工具」 Pi Agent 設定 → Skills 面板看到 pitch_video 亮綠燈
完成首次啟動的 720 MB 下載 第 18 章 AI 呼叫工具後卡在「正在準備環境」很久,或錯誤訊息提到 chromium/playwright/ffmpeg 找不到 手動觸發過一次 pitch_video、看到跑完成品;之後每次都很快
設定 rclone Google Drive(可選,但強烈推薦) 第 19 章 成品做完但沒收到雲端通知,得用 File Editor 手動抓檔 成品出現在你手機 Google Drive App 指定資料夾

三個做完才算「整條管線通了」。如果你只想先試試不設 Google Drive 也行——成品會留在 /data/pi-agent/projects/,用檔案總管 add-on 抓也不會太麻煩,只是不能自動同步到手機。

建議順序:先做第 15 章(裝 skill)、再做第 18 章(首次下載,順便測試 skill 有沒有裝對),Google Drive(第 19 章)留到你確定「這條管線我會常用」再設也不遲——rclone 認證要開 Google Cloud Console,是三個裡最麻煩的。

做一支影片會花多少錢

好消息:整條管線幾乎沒有金錢成本,唯一花錢的地方就是叫 AI 寫腳本那次 API 呼叫。細算給你聽:

成本項用什麼一支 90 秒影片大約要多少
AI 寫腳本 你在第 5 章接的 provider 用 GLM-4.6 或 DeepSeek-R1:NT$ 0.1-1;用 Claude Sonnet:NT$ 1-4(一支 90 秒影片腳本大約 1-3K tokens,實際依你反覆改幾次而定;價目換算見第 10 章
TTS 配音 edge-tts(微軟提供) 0 元(個人使用免費,微軟目前沒收費)
Playwright 錄畫面 你 HA 主機的 CPU 0 元(吃電,但不需要付 API 費用)
ffmpeg 剪接 你 HA 主機的 CPU(跟 ram) 0 元
Google Drive 上傳 rclone 免費、Google 帳號有 15 GB 免費配額(Gmail/Drive/Photos 共用;2026 年 5 月起,部分地區新開的帳號初始只有 5 GB,要驗證手機號碼才解鎖 15 GB——舊帳號不受影響) 0 元(除非配額用完想升級到 Google One,台灣月費 65 元起跳)
電費 HA 主機多跑一段 CPU 密集運算 幾乎不到 1 元(一支影片 CPU 只多跑幾分鐘)

加起來一支 90 秒影片大概 0.5 到 4 塊台幣(幾乎只是腳本那次 AI 呼叫)。想再省?用便宜的 provider(GLM-Flash)寫腳本,一支不到 1 毛;但腳本會弱一點,取捨看你。

觀念:市面上有 AI 影片產生服務(Synthesia、HeyGen、Pictory)月費動輒 800-3000 塊台幣,才能做這條管線在做的事——而且畫面是他們選的模板,不能任意錄你自己的 HA 儀表板。你自己用 pitch_video 一個月做 30 支影片可能不到 100 塊,還沒外部服務被鎖定的問題。這是「自建管線」對「訂閱雲端」的典型優勢。

進階:你可以調哪些參數

預設值管線出來的成品已經能看了。真的想調可以動這些地方(但不建議剛入門就動,用個幾次熟了再調):

  • 解析度:預設 1080p(Full HD)。改 720p 檔案更小、上傳更快,適合 Line 分享;改 4K 檔案巨大,只有 YouTube 值得。
  • 幀率:預設 30 fps(每秒 30 影格)。改 60 fps 更順但檔案更大;改 24 fps 有「電影感」但畫面卡感明顯。
  • 配音聲音:edge-tts 繁中有 zh-TW-HsiaoChenNeural(女)、zh-TW-YunJheNeural(男)、zh-TW-HsiaoYuNeural(女,比較年輕)。想用中國腔換成 zh-CN-*
  • 配音語速:edge-tts 支援 rate="+20%"(加快)或 -20%(放慢)。旁白偏解說性放慢一點會更好懂。
  • 字幕字型:預設用 Noto Sans CJK。想換成 Google 的思源黑體、蘋方或手寫體都行,把字型檔放進 skill 資料夾指定路徑。
  • 轉場長度:xfade 濾鏡預設 0.5 秒。想快剪改 0.2;想電影感改 1 秒。
  • 字幕位置:預設下方置中。可改上方、左下、大字置中等等(走 libass 的 ASS 樣式)。

這些全部在你裝的影片 skill 的設定檔裡調(安裝在 /data/pi-agent/skills/<skill 名稱>/ 底下,設定檔通常是 config.yamlSKILL.md 內的 YAML frontmatter,實際看該 skill 的 README),用 File Editor add-on 打開改存檔就生效。強烈建議先跑三、五支影片熟悉再動——不然改到什麼會崩你不知道,一崩你也不知道回哪個版本。

注意:skill 內部細節(YAML 結構、ffmpeg 完整參數、Playwright 選擇器)不是這系列教學的範圍。你如果想深入客製,去看 pitch_video 的 README.md 與範例 config;那已經算「開發者領域」,跟這本書的定位不同。

常見卡關與處理方法

  1. 一直卡在「AI 在寫腳本」很久,或腳本內容很淺

    八成是模型不夠深。你可能開了 GLM-Flash 或某個非 reasoning 的模型,它給你的東西就是一坨列點沒層次。解法:換 reasoning 模型——GLM-4.6、Claude Sonnet、DeepSeek-R1 都行(第 12 章詳講)。在 pi-agent 對話框左下角下拉切換一下,然後對 AI 講「用這個模型再寫一次腳本」。

  2. 錄出來的畫面是黑色的、或整支影片沒有畫面

    Playwright 環境沒裝好。這是最常見的第 18 章卡關——首次啟動下載一半斷線、Chromium 沒解壓完、缺共用函式庫。解法:回第 18 章的「重新觸發下載」段落,把 /data/pi-agent/playwright-cache/(Playwright 下載 Chromium 的位置)跟 sentinel 檔 /data/pi-agent/.video-tools-installed 一起刪掉,重啟 add-on 就會重新裝一次。

  3. 成品有畫面有配音,但沒字幕、或字幕是豆腐/問號

    兩種可能:(a)SRT 沒有被 ffmpeg 燒進去——去 skill 的設定檔看有沒有「字幕/subtitle/burn」相關開關(實際欄位名依 skill 版本,看 SKILL.md);(b)字幕燒進去了但字型缺——這條 add-on 的 fonts-noto-cjk 是烤在映像檔裡的,理論上不會缺;如果 ffmpeg 報找不到字型,通常是 skill 指定了非預設字型檔路徑而該檔不存在。解法:把 skill 設定裡的字型改回 Noto Sans CJK TC,或先跑 fc-list :lang=zh-tw(在 ttyd 終端)確認系統認得哪些繁中字型。

  4. 成品做完了,Google Drive 沒收到

    rclone 沒設好、或者你的 Google 帳號當月配額爆了。解法:先去 第 19 章的「檢查 rclone 狀態」段落跑診斷。實務上最常見是(a)rclone token 過期(Google 有時 6 個月會過期一次,要重新授權)、(b)Google Drive 免費 15 GB 塞滿了(去 Google 一鍵清 Gmail 附件、去掉不要的 Google 相簿備份就有空間了)。

  5. 整支影片跑一半當機、HA 變超慢

    你的 HA 主機 CPU 或記憶體吃緊。管線需要 2GB+ 記憶體、雙核心 CPU才跑得順;如果你是 Raspberry Pi 3 或超舊的 mini PC 可能會卡。解法:(a)看 HA 系統 → 硬體檢查記憶體使用量;(b)先關掉其他吃資源的 add-on(Frigate、Whisper 這種);(c)真的太弱就換一台 Pi 5 或 x86 mini PC;(d)折衷做法——把影片解析度改成 720p、幀率改成 24fps,資源需求會少一半。

  6. 配音聽起來一直卡卡的、有雜音

    edge-tts 送微軟伺服器的網路不穩。解法:確認 HA 主機能穩定連外ping speech.platform.bing.com 看有沒有丟包);換一支不同的聲音(zh-TW-HsiaoChenNeural 通常比較穩);或等網路好再重跑。這不是管線的問題,是外部依賴的問題。

常見問題

可以用這條管線剪 1 小時的長片嗎?
技術上可以,實務上非常不建議。理由:(1)配音一小時 edge-tts 要跑十幾分鐘、(2)Playwright 錄一小時要真的錄一小時、(3)ffmpeg 合這麼長檔案要 30 分鐘以上、(4)錯了一個字整條要重跑一小時。建議上限 5 分鐘——超過就拆成多集(例如「陽台種菜第一集:選盆」、「第二集:土壤」),還比較好看、好分享、好重製。長片是給人力剪輯的、短片是給 AI 管線的,這個分野很自然。
配音一定要用 AI 嗎?我想用自己的聲音
不用。管線的第 2 步(配音)產生的是 voice/*.wav,你可以用手機錄音 App 自己念一遍存成 mp3/wav,然後手動替換掉這個資料夾裡的檔案,再叫 AI「用現有的配音重跑第 4-6 步」(剪接、燒字幕、上傳)。這樣成品就是你自己的聲音+ AI 幫你錄的畫面+ AI 幫你打的字幕。反過來如果你只要腳本、自己剪片,跑到第 1 步拿到 script.md 就好,其他步驟叫 AI 別做。
版權音樂怎麼辦?我想加背景音樂
管線不處理背景音樂——它只放旁白,沒有音樂軌。你有三個選擇:(a)成品出來後用手機 CapCut 或桌面 iMovie 加背景音樂(建議法);(b)改 pitch_video skill 的 ffmpeg 參數塞一軌 -i background.mp3(進階,別剛入門就動);(c)YouTube 影片直接用 YouTube Audio Library 的免費音樂(上傳後在 YouTube 編輯器加)。重要提醒:無版權音樂要真的無版權——「聽起來很像 XXX」不算,被 YouTube 判斷侵權會被消音或收益被拿走。免費庫例如 YouTube Audio Library、Free Music Archive、Pixabay Music。
成品解析度可以調嗎?我想要 4K
可以,改 pitch_video skill 的 ffmpeg 參數即可(scale=3840:2160)。但先想清楚有沒有必要:(1)Playwright 錄畫面來源如果是 1080p 瀏覽器視窗,強拉到 4K 只是把畫素放大,並不會「變清楚」;(2)4K 檔案巨大——一支 3 分鐘影片可能 500MB-1GB,上傳、分享、Line 傳都痛苦;(3)多數人手機看 1080p 已經很好。比較實用:把來源瀏覽器視窗設成 1440p(viewport: 2560x1440),輸出仍是 1080p,這樣畫面元素比較大、字比較清楚——比追 4K 有意義。
我可以只用管線做配音,不要影片嗎?(Podcast 用途)
可以,但這條影片 skill 本來就是「影片」導向。想做 Podcast 建議直接叫 edge-tts——這個工具本身能單獨用;在 ttyd 終端跑 /data/pi-agent/venv/bin/edge-tts --voice zh-TW-HsiaoChenNeural --text "你的稿" --write-media out.mp3 就吐一段 MP3。或者你就跑影片 skill 一次,拿產物裡的音檔用就好,剪接階段的畫面成品當副產物丟掉。未來 pi-agent 生態可能會出專門的 podcast skill,關注官方 changelog。
做出來的影片可以直接上 YouTube 賺錢嗎?
技術上可以上傳,能不能賺錢牽涉三件事:(1)AI 揭露——YouTube 從 2024 起要求 AI 生成的合成內容要在描述標示,不標可能被限流;(2)頻道要達 YouTube 開放收益的門檻(訂閱 1000+ 加上收看時數,跟 AI 沒關係);(3)內容原創性——AI 生成的內容 YouTube 有時判定為「大量產製、低價值」(AI Slop),會不能開收益。結論:純 AI 產影片衝流量很難成功;把管線當「輔助工具」(AI 出草稿、你人工優化、加你自己觀點),比較有可能成事。
做出來的成品在 Line 上朋友看得到嗎?
看得到。Line 支援 MP4,管線輸出就是 MP4。但注意兩件事:(1)Line 對影片有大小限制(一般約 200MB),管線輸出 1080p 一支 90 秒大概 20-40MB,遠遠夠用;(2)Line 訊息串上的影片預設是靜音播放,這也是為什麼字幕燒進畫面很重要——不是外掛字幕,是燒進畫面的那種——沒有燒的話滑過去沒人知道你在講什麼。管線預設就是燒字幕,這一步別關掉。
我沒有 GPU,這條管線跑得動嗎?
跑得動,管線完全用 CPU 就能跑——Playwright 錄畫面、ffmpeg 剪接都不需要 GPU(不像那些「AI 生成影片」服務要 H100 顯卡)。需求是這樣:CPU 至少雙核(現代的 Pi 4/Pi 5、任何 x86 mini PC 都行)、記憶體 2GB 以上(Pi 4 4GB 版舒服、8GB 版更舒服)。跑不動的機型:Pi 3 或者太舊的 mini PC(賽揚 J1900 之類)可能會慢到不能用。跑的時候 CPU 會滿載幾分鐘——這是正常的,跑完就恢復。
字幕支援中英雙語嗎?
預設是一種語言。雙語做法:跑完後拿 subtitles.srt 檔用 Google 翻譯(或叫你 pi-agent 裡的 AI 翻譯)成英文版,另存成 subtitles.en.srt,上傳到 YouTube 時附上就有雙語字幕可切換。燒進畫面的雙語(同時顯示中英)要改 pitch_video skill 的字幕產生邏輯,屬於進階客製;剛入門建議先靠 YouTube 平台的多語字幕功能就好。
如果我改壞了 skill config,怎麼還原?
最保險:改前先備份設定檔(用 File Editor 開檔 → 另存 .bak)。壞了直接把 .bak 改回去。如果連 .bak 也忘了:多數 skill 會在自己的 repo 附一份預設設定(檔名常見的有 config.yaml / config.default.yaml / SKILL.md 內嵌範例,實際看你裝的版本),照原檔抄回去即可。實在都沒了就把整個 /data/pi-agent/skills/<skill 名稱>/ 刪掉,用第 15 章的方法重裝一次——skill 本體通常只有幾 MB,重裝很快,只是你要重新設一些偏好。