AI 剪輯很神?2 天踩坑經驗和祛魅

使用 Skill 生成 30 秒動畫,折騰 ChatCut、CodeX AI 自動剪輯,意外發掘 Perplexity 搜尋優勢;過程中對文案、Skill 的啟發和認知調整

AI 剪輯很神?2 天踩坑經驗和祛魅

起因在 X 上看到 Funky 分享用 Grok 加上 gbro-collage-broll 的 Skill 在 5 分鐘製作一個 SpaceX 簡介影片,加上現在鋪天蓋地 ChatCut 剪輯有多神、CodeX 自動化能夠讓影片編輯的效率提升等分享,就打算著手嘗試 2 件事情

  1. 從 0 開始的 Idea,AI 會如何寫稿、配音、生成畫面
  2. 30+ 總計 50G 以上的旅遊影片,會如何自動編輯

首先 AI 完全從 0 開始完成一個 30s 的影片,這能力確實已經很強了,在之前是從來沒法想像僅憑一人、一個下午能夠完成這個程度的影片結果,雖然對預期的結果要求太高還是沒有很滿意,但它讓我看到更多實踐上的可能性;當然這過程中也踩了一些坑和彎路,有和 Claude Code 收斂後分享這個過程

Vox 拼貼動畫效果 / gbro-collage-broll - Gitbhub skill

另外就是全網都在討論很神的 ChatCut,自動化的口播剪輯和動畫修改,看者 Demo 影片確實是很讓人驚艷,它適合的是單純對鏡頭的談話、訪談的剪輯

因為 ChatCut 在 CodeX 個概念是,你必須先上傳所有檔案到它的雲端裡去分析,這就天生限制,它就是不適合支援 1G 以上多個檔案上傳再編輯,另外原始影片更多是偏風景、無特別口播、對話的畫面,它是沒法判斷邏輯和前後關係;它主要是先讀取音頻來判斷,而非分析畫面

ChatCut

CodeX 操作剪映這個就更不解了,先是建立個專案然後讓 ChatGPT 整理原始影片檔案、分類;但在開啟剪映要匯入素材後就一直卡住,還另外複製了一組檔案作為編輯用的,浪費了很多硬碟空間,後來是直接刪除就放棄

在搜尋過程中腦海突然閃過 Perplexity 這個選項,意外的找到了很好懂、有實例操作用 AI ( CodeX ) 做編輯的範例《 CodeX 自動剪片完整教學

打中我的點在於他明確了流程給出提示詞,分享了自己的影片編輯 Skill,上傳 42 秒用手機錄的影片丟給 ChatGPT,串接 ElevenLabs API 做語音轉文字、使用思源黑體到最後等待 20 mins 生成有字幕、效果的完整範例

Perplexity

這發現意外的讓我對 Perplexity 的搜尋和研究能力有更好的評價,想到把搜尋用 Perplexity 執行這件事包成一個 Agent research Skill,因為就這個 AI 影片編輯的案例搜尋結果來說,Perplexity 一次搜尋就有了比 Claude Code Fable 5、ChatGPT 5.6 都要好的結果

Update Perplexity api key & Create Skill

AI 影片編輯流程、限制在哪裡?

首先是粗剪和篩選檔案、給指令,如果是從 0 開始沒有任何沉澱,確實責任在你;CodeX 可以幫你整理、分類、標記,但是到導入和剪輯這裡就一直卡住,權限、導入、操作限制這塊還沒釐清,估計要再去看看 Video Use Skill

再來是你作為一支影片的攝影、導演、後期編導的角色本來就有責任給出完整的指令和參考,若是你完全沒經驗,可能還是直接用一些剪輯 App 內建的 AI Highlight 功能其實就可以了,現階段還不適合在這些工具上折騰

概念嘗試:Vox 風格短影音講解 Neocloud

一支 Vox 風格的直式短片,講 Neocloud – 專門為 AI 運算而生的新雲

畫面走紙拼貼風:單色紙面當背景,黑白網點的照片剪成一張張紙片,類似停格動畫那樣一件一件組裝進畫面。英文旁白,字幕直接結合在畫面裡發抖音小紅書

Storyboard by gbro-collage-broll Skill
  • 本地端指令安裝 Grok
  • 輸入 Grok 啟動任務
  • 安裝拼貼動畫 Skill https://github.com/pyang5166/gbro-collage-broll
  • 輸入創作想法「 一個 30 秒介紹 Neocloud 的影片,內容參考 CNBC 的 Youtube 介紹和內容結構,呈現是 Vox style,使用安裝的 gbro-collage-broll 完成.... 」
  • 串接 Google API、充值額度才能再下一步生成圖片
  • 按 Skill 的步奏,首先確認視覺素材、關鍵元素
  • 生成靜態畫面確認
  • 進入視頻生成,完成配音和字幕
Script

如何再更 “好” 一點,文案雕琢和內容結構安排

AI 明顯沒有人類直覺上「 難看 」或是「 不好 」的概念,需要給出明確的執行標準、內容結構、禁止事項來定規矩確保它能夠產出符合你最低標準的內容,這部分會讓人挺沒耐心的,不確定為何提到了很多禁止 AI Slop 沉澱下來的規則還是累犯

  • 字幕逐字必須等於旁白配音,一個字都不能差
  • 句尾不加句號,AI 和 GPU 中間不留空格 ( 是詞不是單個字母 )
  • 整篇文稿不准出現破折號,停頓用逗號
  • 全片禁止黑畫面,連一格都不行 ( AI 在畫面鏈接有漏掉的關鍵幀,導致黑屏 )

目前想到就這 4 點吧,好的內容永遠還是 First priority,現在更有深刻體悟

這些文案上的規則之前 《 什麼是 AI感?如何是有人味表達 》 裡有收斂一些,特別關鍵的就是破折號的使用、句型過於工整、標點符號過度使用都是挺關鍵的,這些都是一眼看去導致充滿 AI 感的元素

什麼是 AI 感?如何是有人味表達
Claude 對話收斂對人和 AI vibe 的判斷及範例;訓練寫作,培養 Human taste、輸出是不可替的思考過程

AI 影片編輯到什麼程度?還能再做哪些嘗試

首先特別有體悟的事情仍然是,一個人如果有好的內容、結構化的思維和清晰的表達能力,本來就能更容易的借助任何工具或平台,在 AI 的輔助下,把想法和知識更高效的傳達給還沒有這些 Domain Knowledge 的受眾

不過,要做出“大片” – 也就是有 Taste、風格明確、起承轉合與編排都很完整的作品,這個過程確實還有一點距離,必須得花時間

但我持續分享案例每天折騰各種新工具,在當下確實很難立刻就獲得了什麼成果,也懷疑自己到底是不是浪費了 2 天嘗試,但又什麼都沒做到,這篇文章也不是要真的鼓勵你退坑,或對 AI 工具祛魅

是明確地想告訴你,在嘗試這流程和操作後,透過這些案例,有哪些路徑是能夠實現特定的預期效果。當你看到已實現的成果,能讓你明白達成這件事情並不是那麼遙不可及,連我都能做到,你也一定有能力基於這個過程思考更多、有動力去實踐、思考如何組織這些技能和經驗去達成目標

  1. 影片或工作流程中,網站是不是也可以有類似拼貼動畫的交互效果?
  2. 寫文案的時候,怎麼樣去思考同時適合影片的內容結構格式?
  3. 透過不同風格的圖片、Graphic design,能否補充在技術文件中?

知識是網狀的,這些經驗、過程,會沈澱在你的大腦和記憶里。在某些時刻,它們會讓你有一些觸類旁通的思考及想法突然呈現出來。這種抽象化思考和能夠連接看似很遠的某些事情的能力,或者說 taste,是真的很需要培養

關於上面提到的個思考,也沒有什麼好答案,但我一直用這樣的方式來提醒自己:

放手去折騰,嘗試把這些過程真實地記錄下來,沈澱思考。因為當你真的覺得有一件事情很想做的時候,你就會繼續做,不用在意它是不是半途而廢,或者在某個地方卡住了。只要開始,你就已經踏出了很多人都沒能踏出的那一步

至少還是有接續上一篇給自己立的目標,保持內容輸出的習慣