第一站
字幕轉錄
產出raw.srt+raw.txt 使用工具
Breeze/WhisperPython 3.11ffprobe
為什麼要做
先把口白變成帶時間碼的文字,後面才能依照內容決定哪裡要留、哪裡要剪。
AI VIDEO EDITOR · STARTER KIT
從字幕轉錄、剪點規劃到成品覆核,沿著六站完成第一支可以直接檢查的 AI 剪輯影片。
請把我指定的口播影片剪成一支可以直接檢查的 9:16 短影音。請實際操作檔案與工具,依序完成以下流程;不要覆寫原始素材,也不要把尚未完成的步驟回報成成功。 開始前,先在目前的素材資料夾找到來源影片。若有多支可能的來源,列出檔名並只問我一次要使用哪一支;若只有一支就直接開始。 第一站|字幕轉錄 1. 使用 ffprobe 讀取長度、尺寸、幀率、旋轉資訊與音訊軌,並抽看影片的開頭、中段與結尾。 2. 使用現有的本機 ASR(Breeze、faster-whisper 或 Whisper)產生帶時間碼的 raw.srt 與 raw.txt。 3. 檢查逐字稿是否有明顯漏字、錯字或時間碼漂移,保留原始轉錄檔供後續對照。 第二站|規劃剪點 1. 讀完整份逐字稿,找出長空白、重拍、錯誤開頭、口誤後重講與不影響語意的贅句。 2. 建立 edl.json,明確記錄保留與移除區間,讓它成為後續剪輯的唯一時間依據。 3. 保留自然呼吸、完整語意與句子邊界;任何不確定的剪點都要回聽音訊或檢查波形。 第三站|剪出主片 1. 依照 edl.json,用 FFmpeg 完成 trim、concat 與音訊銜接。 2. 一次完成必要轉碼,避免反覆壓縮;輸出 1080 × 1920、H.264 的 clean-cut.mp4。 3. 播放檢查每一個接點,若出現切字、突兀停頓或爆音,就調整 EDL 後重新輸出。 第四站|加入字幕 1. 把 raw.srt 的時間重新映射到剪後時間軸,校正明顯錯字並輸出 final.srt 與 final.txt。 2. 使用可顯示繁體中文的字體製作清楚、可讀、位於安全區內的字幕。 3. 確認每句字幕與口白同步,不遮住臉部與重要畫面,並輸出 captioned-cut.mp4。 第五站|HyperFrames 視覺繪製 先讀 final.txt、edl.json 與 captioned-cut.mp4,依語意切成 beats,只在能幫助理解、節奏或記憶的段落加入視覺;若環境提供 skills,先載入 hyperframes、hyperframes-core、hyperframes-creative 與 hyperframes-animation 的任務所需規範。以 captioned-cut.mp4 為主影像軌,用 HyperFrames 製作 9:16 畫面時,要把提示轉成具體內容而不是空泛模板:先固定背景色、前景色、單一強調色與字體,以背景/中景內容/前景細節建立層次,安排至少兩個視覺焦點,並用邊緣錨定、分區構圖與足夠大的文字填滿畫面;避開無目的的漸層字、同尺寸卡片陣列與全部置中。講者、字幕和關鍵畫面必須留在安全區,先確認代表性靜態幀在沒有動畫時也成立,再選 2–4 個動作規則,以單一、可 seek、可重現的時間軸加入進場、強調與環境動態;執行 npx hyperframes check、抽看代表幀後,渲染 first-cut.mp4,並把視覺段落、用途與時間碼記錄在 visual-plan.md。 第六站|成品覆核 1. 使用 ffprobe 確認影片可解碼、有音訊軌、尺寸、幀率與長度正確。 2. 檢查異常黑畫面、長時間凍結、字幕或視覺元素超出安全區、代表幀構圖,以及開頭或結尾被切字。 3. 發現問題就回到對應站點修正,直到所有檢查通過。 完成後,把以下檔案放進新的 output/ 資料夾: - first-cut.mp4 - final.srt - final.txt - edl.json - visual-plan.md - edit-report.md(記錄剪輯內容、使用工具與覆核結果) 除非缺少素材、工具或必要資訊,否則不中途停下。最後請回報輸出路徑、影片長度、移除的內容與覆核結果。第一站
先把口白變成帶時間碼的文字,後面才能依照內容決定哪裡要留、哪裡要剪。
第二站
讓 AI 先讀完整段落再做決定,避免只看局部文字就切掉自然呼吸或完整語意。
第三站
依照同一份 EDL 一次完成剪接與轉碼,讓所有剪點可追蹤,也避免反覆壓縮素材。
第四站
把字幕重新對齊剪後時間軸,再渲染成清楚、同步且位於安全區內的畫面。
第五站
先讓每個靜態畫面具備清楚的內容、層次與焦點,再用可重現的時間軸加入真正有助理解的動態。
第六站
在交付前檢查影像、音訊、字幕、視覺構圖與每個剪接點,發現問題就回到對應站修正。
| 只有 Prompt | AI 剪輯師 |
|---|---|
| 節奏單調 | 知道什麼時機該加什麼內容 |
| 永遠不變的字卡 | 透過模式輪替,讓影片不會越看越無趣 |
| 不會自己抓素材與其他能力 | 能抓素材、音效、迷因、降噪、去背、生圖/影片 |
| 只能剪口播 | 支援單素材、多素材、無素材模式,以及一般、跳動、編排字幕 |
一條最小但完整的路線:完成第一支乾淨、有字幕、有重點視覺且可播放的影片。
P0 到 P5 是不會跳站的主軸;每一站再向外調度需要的支線,完成並過閘後才進下一站。