禮拜天下午,你拍完一段三十分鐘的口播,準備剪成一條五分鐘的成片。打開剪輯軟體,光是把「呃」「等一下我重講」「那個⋯⋯」這些廢話一句句框出來刪掉,就耗掉你兩個鐘頭。調色、上字幕、補幾個動畫,又是一個下午。等你導出來,太陽都下山了——而這只是一條片。做內容的人都懂這種痛:真正花時間的從來不是「拍」,是「剪」。browser-use 這次開源的 video-use,想動的就是這塊最累、最不想碰的活:把原始素材丟進一個資料夾,跟 Claude Code 講一句話,它幫你剪。
一句話結論:video-use 是 browser-use 開源、破萬星的 AI 剪片工具,把原始片段丟進資料夾、用 Claude Code(或 Codex、Hermes)對話下指令,它就幫你剪掉廢話與空白、自動上字幕、調色、補動畫,還會自己檢查爆音才給你看——常剪片的人最該認識。
(截至 2026 年 6 月。video-use 仍在密集開發,版本與功能以官方 GitHub 為準。)
video-use 是什麼?一句話搞懂
video-use 是 browser-use 團隊開源的剪片工具——對,就是那個給 AI 裝上「瀏覽器之眼」、讓 agent 會自己上網點按鈕的知名項目。這次他們把同一套思路搬到影片上:到 2026 年 6 月已經累積約 1.05 萬顆 GitHub 星、1,500 多個 fork,主打「用 Claude Code 剪片,100% 開源」。
用法直白到有點反常:你把一堆原始片段丟進一個資料夾,在 Claude Code(或 Codex、Hermes、OpenClaw 任何能跑 shell 的 agent)裡打一句「把這些剪成一條發布片」,它會先盤點你的素材、提一個剪輯策略給你確認,然後自己跑完,最後在素材旁邊吐一個 edit/final.mp4 給你。談話頭、Montage、教學、旅遊 vlog、訪談都行,沒有預設範本、也不用在一堆選單裡點來點去。
它具體幫你做掉哪些剪片的活?
幫你做掉的,剛好都是最枯燥、最吃時間的那幾樣。我把官方列的能力整理成你接手後「本來要自己動手」的對照:
| 剪片環節 | 你平常怎麼做 | video-use 怎麼幫你做 |
|---|---|---|
| 刪廢話 | 逐句聽、框出「呃/重講/停頓」手動刪 | 自動剪掉填充詞與鏡次之間的死空白 |
| 剪接點 | 怕爆音,手動拉淡入淡出 | 每個切點自動加 30ms 音訊淡化,杜絕「啪」聲 |
| 調色 | 一段一段套 LUT 或手調 | 每個片段自動調色(暖色電影感/中性,或你自訂的 ffmpeg 鏈) |
| 字幕 | 聽寫、斷句、對時間軸 | 燒錄字幕,預設兩字一塊大寫,樣式可全自訂 |
| 動畫疊層 | 另開 AE/模板做 | 用 HyperFrames/Remotion/Manim 開平行 sub-agent 生成 |
| 檢查 | 反覆預覽抓跳接、爆音、字幕擋臉 | 渲染後自我評估每個切點,過關才給你看 |
還有一個容易被忽略、但很實用的設計:它會把這次的剪輯決定寫進一份 project.md,下週你再開同一個案子,它接得回上次的進度,不用從頭交代一遍。對要連續產片的人,這等於幫你保留了「剪輯記憶」。
AI 怎麼在不「看」影片的情況下幫你剪片?
這是 video-use 最聰明、也最值得拿出來講的一點:那個大語言模型其實從頭到尾都沒有「看」你的影片,它是「讀」影片。整套設計就建在這個取巧上,分兩層。
第一層是聲音的逐字稿。它用 ElevenLabs 的 Scribe 把每段素材轉成「字級時間軸」——精確到哪個字在第幾秒、誰在講、甚至標出(笑聲)(掌聲)這類聲音事件,全部打包成一份大約 12KB 的純文字。這份文字,就是 AI 拿來判斷「哪句留、哪句剪、從哪一秒切」的主要依據。第二層是畫面,但只在需要時才看:碰到曖昧的停頓、要比較哪一條鏡次好、或想確認切點順不順,它才生一張「膠片條+聲波+字標」的截圖來瞄一眼。
硬塞整段影片給 AI 「看」,三萬幀 × 每幀一千五百個 token,等於四千五百萬個 token 的噪音。video-use 只用 12KB 文字加上幾張截圖。官方一句話點破:這跟 browser-use 給 AI 一個結構化的網頁 DOM、而不是丟一張截圖,是同一招——只是換成了影片。
整條流水線是這樣跑的:轉錄 → 打包逐字稿 → AI 想剪輯邏輯 → 生出一份剪輯決策清單(EDL)→ 渲染 → 自我檢查(最多自己修三輪)。聽起來繞,但對你來說只有兩個動作:丟素材、講一句話,剩下的它自己處理。會省 token、會更準,是因為它把「剪片」這件事,從「看影像」偷換成了「讀文字」。
不會寫程式也能用嗎?三步上手
能,全程用講的跟 AI 對話,不用自己寫程式碼。但要先有個心理準備:它不是「打開網頁、按一下」的線上服務,而是一套跑在 AI agent 裡的工作流,第一次要花點時間把環境架起來。流程大致三步:
- 把安裝指令貼給你的 AI agent。官方給了一段現成的設定提示,直接貼進 Claude Code、Codex、Hermes 或 OpenClaw,它會自己把 repo 抓下來、接好 ffmpeg、把 skill 註冊好,然後問你要 ElevenLabs 的 API 金鑰(到 elevenlabs.io 免費申請一組貼給它就行)。
- 備好兩個必要工具。系統要有
ffmpeg(剪片、轉檔的底層引擎,必裝);想直接抓線上影片來剪,再裝yt-dlp(選用)。手動安裝的話就是git clone之後跑uv sync或pip install -e .。 - 進到素材資料夾,開口下指令。
cd到放原始片段的資料夾,開 Claude Code,講一句「把這些剪成一條發布片」。它會先列出素材、提一個剪輯策略等你點頭,再自己剪完,把成品放到同資料夾的edit/裡,skill 目錄保持乾淨。
講白一點:純新手的門檻全卡在第一關「架環境」。一旦裝好,後面真的就是把影片丟進去、用嘴巴下指令而已。如果你已經在用 Claude Code 或 Cursor 這類 AI agent,幾乎是零摩擦就接得上。
自己用 video-use,跟外包剪片差多少錢?
video-use 工具本身免費開源,真正的硬成本是兩塊:ElevenLabs 轉錄的用量,加上你那個 AI agent 的呼叫費用,兩者都按量計費。所以值不值,要拿它對上「外包剪一條片的價錢」。下面這個小工具幫你抓個概念,數字都能自己改:
它不是「許願池」:用之前要知道的限制
先潑點冷水,免得期待落空。第一,它靠聲音來剪——切點是從「講話的邊界」和「靜音的空檔」算出來的。所以對白清楚的口播、訪談、教學最吃香;如果你的片很吃畫面節奏、配樂卡點、或大量無人聲的空鏡,AI 的判斷就沒那麼神,你要接手調的會比較多。
第二,它有底線、也有自由:官方說「12 條硬規則照做,其餘交給品味」。意思是製作正確性(不爆音、字幕別擋臉那種)它幫你守死,但「好不好看、有沒有風格」這種審美的事,最後還是你說了算。第三,它要 ElevenLabs API 金鑰、要 ffmpeg、要一個能跑 shell 的 AI agent,這幾樣缺一不可。把它當成一個很強的「初剪產生器」,而不是「一鍵出大片」,期待值會剛好。
video-use 適合誰?不適合誰?
適合的人很明確:要固定產片的 YouTuber、做 Reels/短影音的、錄線上課的老師、常做教學與訪談的內容創作者——尤其是「片很多、剪到怕」、又願意花一個下午把環境架起來的人。已經在用 Claude Code、Codex 這類 AI agent 的人,幾乎零摩擦就能接上,等於多一個「會剪片的虛擬同事」。
不適合的也很清楚:只想「上傳、按一下、下載」、完全不碰安裝的人,那你要的是線上型 AI 剪輯服務(像 CapCut、opus.pro 那類),不是它。還有,做電影感強、要逐幀摳細節的商業大片,這種講究的活它幫不了你太多——它的強項是把「大量、重複、講話為主」的片快速做出初剪。
對怕被 AI 取代、想靠內容賺錢的人,有什麼用?
這才是我覺得 video-use 對一般人最值得玩的地方。剪片,本來就是很多人做副業、接案、經營自媒體的入門門檻——也是最容易半途放棄的那道坎,因為太花時間。當「剪」這件事的單位成本被壓下來,你能產出的片量、能接的單,直接就拉開了。客戶要改?把素材丟回去重講一句指令就好,不用整條重剪。
更值錢的是順手學到的東西。為了用它,你會碰到 AI agent、API 金鑰、ffmpeg、命令列這套底層能力,遷移性極高——今天拿來剪片,明天就能拿去自動化別的雜活。AI 不是只會把工作收走,它也在把「以前要花錢外包的事」開放給願意動手的個人。重點從來不是「我會不會被取代」,而是「這些開源彈藥,我有沒有撿起來用」。
我會怎麼看 video-use?
我最欣賞的是它那個「不看影片、改成讀影片」的決定。一堆 AI 剪輯工具拼命想讓模型「看懂」整段畫面,結果又慢又貴;video-use 反過來,認清「剪片的關鍵資訊其實藏在聲音的時間軸裡」,把問題從影像偷換成文字,省下的是數量級的成本。這種「想清楚問題本質再動手」的工程品味,比功能表多長一截更難得,也很 browser-use。
但要誠實講:它不是給所有人的工具。架環境有門檻、吃 ElevenLabs 用量、又特別偏好「以講話為主」的片。如果你正好是「片多、講話為主、願意動手」的那種人,它給的回報相當實在;如果你只想偶爾剪一條、又一行指令都不想碰,那它對你就太重了。工具沒有絕對好壞,是看你拿「省事」換多少「掌控」。
常見問題
video-use 要錢嗎?
工具本身免費、開源。但它要呼叫 ElevenLabs 做轉錄、要用一個 AI agent(如 Claude Code)來驅動,這兩者都按量計費。所以實際成本是「轉錄用量+模型用量」,剪越多片、越長的片,花得越多。想壓成本可挑便宜的模型,但品質會跟著降。
不會寫程式能用 video-use 嗎?
能,全程用講的跟 AI 對話,不用自己寫程式碼。官方甚至給了一段現成安裝提示,貼給 Claude Code 它就幫你裝好。唯一對純新手有門檻的是第一次「架環境」(裝 ffmpeg、設 ElevenLabs 金鑰),跨過去之後就是丟素材、下指令而已。
video-use 一定要用 Claude Code 嗎?
不一定。它支援任何能跑 shell 的 AI agent,包括 Claude Code、Codex、Hermes、OpenClaw 等。Claude Code 是官方示範最完整的選擇,但你慣用哪個都能接。
它能剪什麼類型的影片?
談話頭、Montage、教學、旅遊、訪談都行,沒有預設範本。但因為它靠聲音逐字稿來判斷切點,對白清楚、以講話為主的片效果最好;很吃畫面節奏或大量空鏡的片,需要你自己接手調整的部分會比較多。
不喜歡 video-use,有什麼替代方案?
看你最在意哪一塊。完全不想安裝、要手機上一鍵剪好,去看 CapCut、opus.pro 這類線上/App 服務,上手最快,代價是流程被它綁死、資料放在雲端。已經習慣專業剪輯、只想要 AI 幫忙打逐字稿和粗剪,可以用 Premiere、DaVinci Resolve 內建的語音轉文字功能。要的就是「用 AI agent、在本機、把講話為主的片快速做成初剪、而且高度可客製」,那目前 video-use 把這個位置切得算乾淨,值得花那段學習成本。沒有哪個絕對最好,是看你願意拿多少「方便」換「掌控」。
延伸閱讀
- YC 總裁 Garry Tan 的 Claude Code 配置 gstack:23 個指令把它變成一整隊工程團隊
- ppt-master 是什麼?AI 把任何檔案變「真·可編輯」PPT
- Agent Reach:一句話讓你的 AI agent 免費讀遍整個互聯網
- AI Berkshire:用 Claude Code 把四位投資大師變成你的投研團隊
※ 本文為工具教學與資訊整理,截至 2026 年 6 月。video-use 仍在密集開發,版本與功能更新極快,實際請以官方 GitHub(browser-use/video-use)說明為準。文中提及之第三方服務(如 ElevenLabs)費用以其官網為準,本文不構成任何投資或商業建議。
延伸閱讀:完整的 GitHub 熱門開源 AI 專案精選,20+ 個開源工具依用途分類收藏、持續更新。






發表迴響