禮拜天下午,你拍完一段三十分鐘的口播,準備剪成一條五分鐘的成片。打開剪輯軟體,光是把「呃」「等一下我重講」「那個⋯⋯」這些廢話一句句框出來刪掉,就耗掉你兩個鐘頭。調色、上字幕、補幾個動畫,又是一個下午。等你導出來,太陽都下山了——而這只是一條片。做內容的人都懂這種痛:真正花時間的從來不是「拍」,是「剪」。browser-use 這次開源的 video-use,想動的就是這塊最累、最不想碰的活:把原始素材丟進一個資料夾,跟 Claude Code 講一句話,它幫你剪。

一句話結論:video-use 是 browser-use 開源、破萬星的 AI 剪片工具,把原始片段丟進資料夾、用 Claude Code(或 Codex、Hermes)對話下指令,它就幫你剪掉廢話與空白、自動上字幕、調色、補動畫,還會自己檢查爆音才給你看——常剪片的人最該認識。

(截至 2026 年 6 月。video-use 仍在密集開發,版本與功能以官方 GitHub 為準。)

video-use 是什麼?一句話搞懂

video-use 是 browser-use 團隊開源的剪片工具——對,就是那個給 AI 裝上「瀏覽器之眼」、讓 agent 會自己上網點按鈕的知名項目。這次他們把同一套思路搬到影片上:到 2026 年 6 月已經累積約 1.05 萬顆 GitHub 星、1,500 多個 fork,主打「用 Claude Code 剪片,100% 開源」。

用法直白到有點反常:你把一堆原始片段丟進一個資料夾,在 Claude Code(或 Codex、Hermes、OpenClaw 任何能跑 shell 的 agent)裡打一句「把這些剪成一條發布片」,它會先盤點你的素材、提一個剪輯策略給你確認,然後自己跑完,最後在素材旁邊吐一個 edit/final.mp4 給你。談話頭、Montage、教學、旅遊 vlog、訪談都行,沒有預設範本、也不用在一堆選單裡點來點去。

它具體幫你做掉哪些剪片的活?

幫你做掉的,剛好都是最枯燥、最吃時間的那幾樣。我把官方列的能力整理成你接手後「本來要自己動手」的對照:

剪片環節你平常怎麼做video-use 怎麼幫你做
刪廢話逐句聽、框出「呃/重講/停頓」手動刪自動剪掉填充詞與鏡次之間的死空白
剪接點怕爆音,手動拉淡入淡出每個切點自動加 30ms 音訊淡化,杜絕「啪」聲
調色一段一段套 LUT 或手調每個片段自動調色(暖色電影感/中性,或你自訂的 ffmpeg 鏈)
字幕聽寫、斷句、對時間軸燒錄字幕,預設兩字一塊大寫,樣式可全自訂
動畫疊層另開 AE/模板做用 HyperFrames/Remotion/Manim 開平行 sub-agent 生成
檢查反覆預覽抓跳接、爆音、字幕擋臉渲染後自我評估每個切點,過關才給你看

還有一個容易被忽略、但很實用的設計:它會把這次的剪輯決定寫進一份 project.md,下週你再開同一個案子,它接得回上次的進度,不用從頭交代一遍。對要連續產片的人,這等於幫你保留了「剪輯記憶」。

AI 怎麼在不「看」影片的情況下幫你剪片?

這是 video-use 最聰明、也最值得拿出來講的一點:那個大語言模型其實從頭到尾都沒有「看」你的影片,它是「讀」影片。整套設計就建在這個取巧上,分兩層。

第一層是聲音的逐字稿。它用 ElevenLabs 的 Scribe 把每段素材轉成「字級時間軸」——精確到哪個字在第幾秒、誰在講、甚至標出(笑聲)(掌聲)這類聲音事件,全部打包成一份大約 12KB 的純文字。這份文字,就是 AI 拿來判斷「哪句留、哪句剪、從哪一秒切」的主要依據。第二層是畫面,但只在需要時才看:碰到曖昧的停頓、要比較哪一條鏡次好、或想確認切點順不順,它才生一張「膠片條+聲波+字標」的截圖來瞄一眼。

硬塞整段影片給 AI 「看」,三萬幀 × 每幀一千五百個 token,等於四千五百萬個 token 的噪音。video-use 只用 12KB 文字加上幾張截圖。官方一句話點破:這跟 browser-use 給 AI 一個結構化的網頁 DOM、而不是丟一張截圖,是同一招——只是換成了影片。

整條流水線是這樣跑的:轉錄 → 打包逐字稿 → AI 想剪輯邏輯 → 生出一份剪輯決策清單(EDL)→ 渲染 → 自我檢查(最多自己修三輪)。聽起來繞,但對你來說只有兩個動作:丟素材、講一句話,剩下的它自己處理。會省 token、會更準,是因為它把「剪片」這件事,從「看影像」偷換成了「讀文字」。

不會寫程式也能用嗎?三步上手

能,全程用講的跟 AI 對話,不用自己寫程式碼。但要先有個心理準備:它不是「打開網頁、按一下」的線上服務,而是一套跑在 AI agent 裡的工作流,第一次要花點時間把環境架起來。流程大致三步:

  1. 把安裝指令貼給你的 AI agent。官方給了一段現成的設定提示,直接貼進 Claude Code、Codex、Hermes 或 OpenClaw,它會自己把 repo 抓下來、接好 ffmpeg、把 skill 註冊好,然後問你要 ElevenLabs 的 API 金鑰(到 elevenlabs.io 免費申請一組貼給它就行)。
  2. 備好兩個必要工具。系統要有 ffmpeg(剪片、轉檔的底層引擎,必裝);想直接抓線上影片來剪,再裝 yt-dlp(選用)。手動安裝的話就是 git clone 之後跑 uv syncpip install -e .
  3. 進到素材資料夾,開口下指令。cd 到放原始片段的資料夾,開 Claude Code,講一句「把這些剪成一條發布片」。它會先列出素材、提一個剪輯策略等你點頭,再自己剪完,把成品放到同資料夾的 edit/ 裡,skill 目錄保持乾淨。

講白一點:純新手的門檻全卡在第一關「架環境」。一旦裝好,後面真的就是把影片丟進去、用嘴巴下指令而已。如果你已經在用 Claude Code 或 Cursor 這類 AI agent,幾乎是零摩擦就接得上。

自己用 video-use,跟外包剪片差多少錢?

video-use 工具本身免費開源,真正的硬成本是兩塊:ElevenLabs 轉錄的用量,加上你那個 AI agent 的呼叫費用,兩者都按量計費。所以值不值,要拿它對上「外包剪一條片的價錢」。下面這個小工具幫你抓個概念,數字都能自己改:

🧮 剪片成本快算:外包 vs 自己用 video-use

它不是「許願池」:用之前要知道的限制

先潑點冷水,免得期待落空。第一,它靠聲音來剪——切點是從「講話的邊界」和「靜音的空檔」算出來的。所以對白清楚的口播、訪談、教學最吃香;如果你的片很吃畫面節奏、配樂卡點、或大量無人聲的空鏡,AI 的判斷就沒那麼神,你要接手調的會比較多。

第二,它有底線、也有自由:官方說「12 條硬規則照做,其餘交給品味」。意思是製作正確性(不爆音、字幕別擋臉那種)它幫你守死,但「好不好看、有沒有風格」這種審美的事,最後還是你說了算。第三,它要 ElevenLabs API 金鑰、要 ffmpeg、要一個能跑 shell 的 AI agent,這幾樣缺一不可。把它當成一個很強的「初剪產生器」,而不是「一鍵出大片」,期待值會剛好。

video-use 適合誰?不適合誰?

適合的人很明確:要固定產片的 YouTuber、做 Reels/短影音的、錄線上課的老師、常做教學與訪談的內容創作者——尤其是「片很多、剪到怕」、又願意花一個下午把環境架起來的人。已經在用 Claude Code、Codex 這類 AI agent 的人,幾乎零摩擦就能接上,等於多一個「會剪片的虛擬同事」。

不適合的也很清楚:只想「上傳、按一下、下載」、完全不碰安裝的人,那你要的是線上型 AI 剪輯服務(像 CapCut、opus.pro 那類),不是它。還有,做電影感強、要逐幀摳細節的商業大片,這種講究的活它幫不了你太多——它的強項是把「大量、重複、講話為主」的片快速做出初剪。

對怕被 AI 取代、想靠內容賺錢的人,有什麼用?

這才是我覺得 video-use 對一般人最值得玩的地方。剪片,本來就是很多人做副業、接案、經營自媒體的入門門檻——也是最容易半途放棄的那道坎,因為太花時間。當「剪」這件事的單位成本被壓下來,你能產出的片量、能接的單,直接就拉開了。客戶要改?把素材丟回去重講一句指令就好,不用整條重剪。

更值錢的是順手學到的東西。為了用它,你會碰到 AI agent、API 金鑰、ffmpeg、命令列這套底層能力,遷移性極高——今天拿來剪片,明天就能拿去自動化別的雜活。AI 不是只會把工作收走,它也在把「以前要花錢外包的事」開放給願意動手的個人。重點從來不是「我會不會被取代」,而是「這些開源彈藥,我有沒有撿起來用」。

我會怎麼看 video-use?

我最欣賞的是它那個「不看影片、改成讀影片」的決定。一堆 AI 剪輯工具拼命想讓模型「看懂」整段畫面,結果又慢又貴;video-use 反過來,認清「剪片的關鍵資訊其實藏在聲音的時間軸裡」,把問題從影像偷換成文字,省下的是數量級的成本。這種「想清楚問題本質再動手」的工程品味,比功能表多長一截更難得,也很 browser-use。

但要誠實講:它不是給所有人的工具。架環境有門檻、吃 ElevenLabs 用量、又特別偏好「以講話為主」的片。如果你正好是「片多、講話為主、願意動手」的那種人,它給的回報相當實在;如果你只想偶爾剪一條、又一行指令都不想碰,那它對你就太重了。工具沒有絕對好壞,是看你拿「省事」換多少「掌控」。

常見問題

video-use 要錢嗎?

工具本身免費、開源。但它要呼叫 ElevenLabs 做轉錄、要用一個 AI agent(如 Claude Code)來驅動,這兩者都按量計費。所以實際成本是「轉錄用量+模型用量」,剪越多片、越長的片,花得越多。想壓成本可挑便宜的模型,但品質會跟著降。

不會寫程式能用 video-use 嗎?

能,全程用講的跟 AI 對話,不用自己寫程式碼。官方甚至給了一段現成安裝提示,貼給 Claude Code 它就幫你裝好。唯一對純新手有門檻的是第一次「架環境」(裝 ffmpeg、設 ElevenLabs 金鑰),跨過去之後就是丟素材、下指令而已。

video-use 一定要用 Claude Code 嗎?

不一定。它支援任何能跑 shell 的 AI agent,包括 Claude Code、Codex、Hermes、OpenClaw 等。Claude Code 是官方示範最完整的選擇,但你慣用哪個都能接。

它能剪什麼類型的影片?

談話頭、Montage、教學、旅遊、訪談都行,沒有預設範本。但因為它靠聲音逐字稿來判斷切點,對白清楚、以講話為主的片效果最好;很吃畫面節奏或大量空鏡的片,需要你自己接手調整的部分會比較多。

不喜歡 video-use,有什麼替代方案?

看你最在意哪一塊。完全不想安裝、要手機上一鍵剪好,去看 CapCut、opus.pro 這類線上/App 服務,上手最快,代價是流程被它綁死、資料放在雲端。已經習慣專業剪輯、只想要 AI 幫忙打逐字稿和粗剪,可以用 Premiere、DaVinci Resolve 內建的語音轉文字功能。要的就是「用 AI agent、在本機、把講話為主的片快速做成初剪、而且高度可客製」,那目前 video-use 把這個位置切得算乾淨,值得花那段學習成本。沒有哪個絕對最好,是看你願意拿多少「方便」換「掌控」。

延伸閱讀

※ 本文為工具教學與資訊整理,截至 2026 年 6 月。video-use 仍在密集開發,版本與功能更新極快,實際請以官方 GitHub(browser-use/video-use)說明為準。文中提及之第三方服務(如 ElevenLabs)費用以其官網為準,本文不構成任何投資或商業建議。

延伸閱讀:完整的 GitHub 熱門開源 AI 專案精選,20+ 個開源工具依用途分類收藏、持續更新。

關於Mr. Slash

「Mr. Slash 的系統性人生」,創立於 2024年,由 Mr. Slash 本人及專業編輯團隊經營的財經內容平台。

我們的宗旨是透過投資、財經、自動化與新興科技等領域的深入解說與應用,幫助讀者打造穩定的被動收入系統。內容涵蓋加密貨幣、股息資產、量化工具、平台分潤等實用策略,協助你用更聰明的方法配置資金、累積資產,走在財務自由的路上,少走冤枉路。

若為商業合作邀稿,將會清楚標註「不代表本站立場」。

商業合作

如果您有任何關於我們團隊或網站內容的疑問或建議,歡迎您前往IG 私訊 @slash.Capital聯繫我們,謝謝!

عن Mr. Slash

«Mr. Slash» منصة محتوى مالي تأسست عام 2024، يديرها فريق تحرير متخصص. نقدّم للقارئ العربي شروحات عملية ومحايدة عن العملات الرقمية وطرق الشراء والإيداع والسحب المحلية في السعودية ومصر والخليج.

هدفنا مساعدتك على فهم السوق واختيار منصة تداول موثوقة وتقليل الرسوم. نحن لا نقدّم نصيحة استثمارية والقرار النهائي يبقى لك؛ وفي حال التعاون التجاري يُوضَّح ذلك صراحةً ولا يمثّل رأي الموقع.

تواصل وتعاون تجاري

لأي استفسار أو اقتراح أو تعاون، تواصل معنا عبر إنستغرام @slash.Capital. شكرًا لك!

發表迴響

相關文章

مقالات ذات صلة

Trending

探索更多來自 Mr. Slash|系統流人生 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀

خصم دائم على الرسوم سجّل في OKX مجاناً ←
Join Mr. Slash