Claude 這一年愈來愈全能:它會讀網頁、會跑腳本、會翻整個 GitHub repo。但有一件事,它出廠時其實做不到——看影片。你貼一條 YouTube 連結給它,它多半只能靠標題猜,或者去撈一份缺了九成畫面的字幕。你問「他在第 30 秒做了什麼手勢」,它其實沒看過那一幀,只能裝作看過。
最近在 GitHub 竄起的開源工具 claude-video(一個叫 /watch 的指令)就是來補這個洞的。它今天單日新增四百多顆星,做的事情很直白:貼一條影片連結,Claude 就會自己下載、抽出畫面、轉出逐字稿,然後「連看帶聽」把整條片吃進去,再回答你的問題。截至 2026 年 7 月,它是 MIT 授權、完全免費。
一句話結論:claude-video 是一個開源指令 /watch,讓 Claude 自動下載影片、抽格、轉逐字稿,真正「看完」任何 YouTube 或本地影片再回答你,不用寫程式,captions 有的話全程免費。
claude-video 到底是什麼?
它是一個裝在 Claude 上的「技能(skill)」,核心就是一個指令:/watch。用法長這樣——你丟一條網址或一個本地檔案路徑,再問一個問題:
/watch https://youtu.be/xxxxxxxx 他開場用了什麼 hook?
背後其實是三個老工具的組合技:yt-dlp 負責下載並優先抓字幕,ffmpeg 負責把畫面抽成一張張圖片,字幕不夠時再交給 Whisper 轉逐字稿。最後這些「畫面 + 逐字稿」會一起餵給 Claude,每張圖都標了時間戳(t=MM:SS),Claude 一張張讀進去。等它回答的時候,是真的看過那些畫面、聽過那段聲音,而不是照著標題腦補。網址支援 yt-dlp 認得的幾百個站,YouTube、Loom、TikTok、X、Instagram 都可以,本地 .mp4/.mov/.mkv/.webm 也吃。
它不挑 Claude 的用法。官方支援三種安裝面:Claude Code 直接裝 plugin、claude.ai 網頁版上傳 skill 檔,甚至 Codex、Cursor、Copilot、Gemini CLI 等五十多個 agent 平台都能用同一套 npx skills 指令裝。作者是 YouTube 上做 AI 內容的 Brad Bonanno。
為什麼「讓 AI 看得見畫面」值得你停下來看?
差別在於資訊完整度。過去要 AI「幫我看片」,主流做法是丟字幕給它。字幕的問題是:它只有「說了什麼」,沒有「畫面上發生了什麼」。一段教學影片,講者說「你看這裡」的時候,字幕不會告訴你螢幕上那個按鈕在哪;一支廣告,真正的重點常常在畫面設計而不是旁白。純字幕漏掉的,往往就是最關鍵的那部分。
claude-video 兩邊都拿:它把畫面抽成圖,讓 Claude 用它的多模態能力「看」;同時保留逐字稿,讓它「聽」。這也是它跟「直接把 YouTube 連結丟給某些模型」最大的不同——那類做法多半只吃到字幕層,畫面細節還是斷的。
不會寫程式,也裝得起來嗎?
可以,這正是它做得好的地方。最省事的是 Claude Code:貼兩行指令就完成,之後還會自動更新。
/plugin marketplace add bradautomates/claude-video
/plugin install watch@claude-video
用 Cursor、Codex、Gemini CLI 這些的話,一行搞定:npx skills add bradautomates/claude-video -g(-g 是裝給整個帳號用)。用 claude.ai 網頁版的人,去 release 頁下載 watch.skill,到「設定 → Capabilities → Skills」按加號拖進去,記得先把「Code execution and file creation」打開,因為它要呼叫 ffmpeg。第一次跑 /watch 時,如果你電腦沒裝 ffmpeg 或 yt-dlp,它會自己幫你裝(macOS 直接用 brew,Linux 和 Windows 會印出該複製的指令),零設定就能開始。整個過程不用你寫任何一行程式。
看一支影片要花多少 token?(成本估算器)
這是用之前最該搞懂的一件事:成本主要來自「畫面」。每一張抽出來的圖都是一張圖片,圖片 token 加起來很快。claude-video 有一套自動邏輯,會按影片長度決定抽幾張圖(30 秒的片抽約 30 張,超過 10 分鐘就封頂 100 張並跳出「稀疏掃描」警告,提醒你不如用 --start/--end 鎖一小段)。下面這個小工具幫你先抓個概念——輸入影片長度、選畫質模式,估一下大概幾張圖、多少 token:
還有一個貼心設計叫「去重」:像投影片停在同一頁 90 秒、或者靜態螢幕錄影,會抽出一堆幾乎一樣的圖,claude-video 預設會把這些近乎重複的幀丟掉,把預算花在真正不同的畫面上。要鎖一小段就加 --start 2:15 --end 2:45,那一段會抽得更密,反而更便宜、更準。
一般人到底可以拿它來幹嘛?
官方列的幾個用法,其實都很接地氣:
- 拆別人的爆款:丟一支病毒式影片,問「他開場前十秒的 hook 是什麼結構」,Claude 會看開頭幾幀、讀開場逐字稿,幫你拆解。做內容的人拿來研究對手、廣告素材、podcast 開場特別好用。
- 從錄影裡抓 bug:同事丟你一段螢幕錄影說「壞了」,你
/watch bug.mov 哪裡出錯,它會找到出問題那一幀、描述畫面,常常你連檔案都還沒打開它就講出原因。 - 把長片壓成摘要:一支落落長的影片,一句「summarize this」就幫你抓結構、關鍵時刻、實際說了什麼,比你自己開 2 倍速還快。
- 把發布會的水分擠掉:問「這支更新影片到底有什麼是真的新的,跳過那些吹捧」,它幫你把十分鐘的鋪陳砍到剩幾個重點。
- 把一整個課程變成筆記:對一系列影片各跑一次,一個頻道或線上課就變成可搜尋的筆記,而不是幾十小時你得乖乖坐著看的內容。
從「幫自己看片」到「靠它多賺一條」
如果你正在想怎麼靠 AI 多開一條出路,這工具其實是個不錯的接口。做短影音的人,可以系統性地拆競品爆款的開場、節奏、轉場,把「看得懂為什麼紅」變成可複製的方法;接案的人,可以提供「影片重點整理/逐字稿+摘要」這種小服務,把過去要人肉看兩小時的活,變成幾分鐘一單;做知識付費的人,可以把一堆散落的教學影片整理成結構化講義。工具本身免費,你賣的是「幫人省下看片的時間」,這門生意一直都有需求。
要花錢嗎?免費到哪、付費從哪開始?
分兩塊看。工具本身、下載、抓「原生字幕」這條路——免費。大部分公開影片都有字幕(人工或自動生成),走這條完全不花錢。只有當一支影片真的沒有字幕(常見於本地檔案、部分 TikTok、少數沒字幕的 YouTube),它才會退而求其次,抽一段音訊丟給 Whisper 轉錄。這時候你要自備 API key:Groq 的 whisper-large-v3 又快又便宜(官方首選),或用 OpenAI 的 whisper-1。不想花這筆,加 --no-whisper,沒字幕時就只用畫面。至於 Claude 這邊的用量,看你原本用哪個方案,圖片 token 會照上面估算器的量計入。價格請以各家官網為準(截至 2026 年 7 月)。
有什麼限制、什麼情況不建議用?
兩個要先知道。第一,長片的準確度看模式:預設的封頂模式在超過十分鐘後,畫面會被攤得比較稀,重點畫面可能漏掉——這時要嘛用 --start/--end 鎖段落,要嘛切到不封頂的 token-burner(但 token 會噴上去)。第二,隱私要注意:如果影片沒字幕、走了 Whisper,那段音訊是會傳到 Groq 或 OpenAI 的雲端的。內部會議、機密錄影這種,建議加 --no-whisper 或先確認合規再用。另外它畢竟是抽幀,不是逐幀播放,一閃而過的細節(單幀彈出的文字)有機會被跳過,真的要摳這種細節就用 --timestamps 指定時間點抓圖。
不想用它,有別的選擇嗎?
當然有,看你的情境:只想要純文字重點、又剛好在用 Gemini,可以直接把 YouTube 連結丟給它(吃字幕層,畫面細節較弱);想做「一堆資料來源+問答」的,Google 的 NotebookLM 很順手;只是要一份逐字稿、不需要 AI 理解畫面,本地跑 whisper.cpp 或前陣子很紅的 meetily 就夠。claude-video 的甜蜜點很明確:你已經在用 Claude,而且你要的是「看得見畫面」的理解,不只是字幕。
新手三步行動清單
- ✅ 用 Claude Code 貼那兩行指令裝好,或用
npx skills add裝進你的 agent。 - ✅ 找一支你本來就想看、但懶得看完的影片,跑
/watch <連結> 幫我抓重點。 - ✅ 想省 token 就先用
--detail transcript或鎖--start/--end,需要看畫面細節再開 balanced。
常見問題(FAQ)
claude-video 是免費的嗎?
工具本身 MIT 授權、免費開源。下載和抓原生字幕不用錢;只有影片沒字幕、要用 Whisper 轉錄時,才需要自備 Groq 或 OpenAI 的 API key,產生一小筆費用。
它跟直接把 YouTube 連結丟給 AI 有什麼不同?
最大差別是它會真的「看畫面」。直接丟連結多半只吃到字幕,畫面上發生的事會斷掉;claude-video 會抽出一張張畫面讓 Claude 讀,畫面加聲音一起理解。
不會寫程式可以用嗎?
可以。安裝就是貼指令或拖一個檔案,用起來就是一句 /watch 連結 你的問題,全程不用寫任何程式碼。ffmpeg、yt-dlp 這些底層工具第一次跑時會自動幫你裝。
會不會很花錢?
主要成本是抽出來的畫面(圖片 token)。短片很便宜,長片建議用估算器先抓個量,或用 --start/--end 鎖一小段,把預算花在你真正想看的部分。
延伸閱讀
- 用 Claude Code 剪影片:讓 AI 幫你「做」影片(這篇是「看片」,那篇是「剪片」,剛好一對)
- Claude Code 新手學習指南:從安裝到第一個指令
- meetily:本地跑、不上雲的開源 AI 會議記錄工具
原始碼與完整說明:github.com/bradautomates/claude-video。本文為獨立整理,claude-video 為第三方開源專案,與本站無任何贊助或利益關係。
免責聲明:本文為 AI 工具教學與資訊分享,非投資建議。文中工具的功能、定價與授權可能隨版本更新而變動,實際請以官方 GitHub 與各服務商官網為準(截至 2026 年 7 月)。使用第三方 API 轉錄影片內容前,請自行確認資料隱私與合規要求。
延伸閱讀:完整的 GitHub 熱門開源 AI 專案精選,20+ 個開源工具依用途分類收藏、持續更新。






發表迴響