Claude 這一年愈來愈全能:它會讀網頁、會跑腳本、會翻整個 GitHub repo。但有一件事,它出廠時其實做不到——看影片。你貼一條 YouTube 連結給它,它多半只能靠標題猜,或者去撈一份缺了九成畫面的字幕。你問「他在第 30 秒做了什麼手勢」,它其實沒看過那一幀,只能裝作看過。

最近在 GitHub 竄起的開源工具 claude-video(一個叫 /watch 的指令)就是來補這個洞的。它今天單日新增四百多顆星,做的事情很直白:貼一條影片連結,Claude 就會自己下載、抽出畫面、轉出逐字稿,然後「連看帶聽」把整條片吃進去,再回答你的問題。截至 2026 年 7 月,它是 MIT 授權、完全免費。

一句話結論:claude-video 是一個開源指令 /watch,讓 Claude 自動下載影片、抽格、轉逐字稿,真正「看完」任何 YouTube 或本地影片再回答你,不用寫程式,captions 有的話全程免費。

claude-video 到底是什麼?

它是一個裝在 Claude 上的「技能(skill)」,核心就是一個指令:/watch。用法長這樣——你丟一條網址或一個本地檔案路徑,再問一個問題:

/watch https://youtu.be/xxxxxxxx 他開場用了什麼 hook?

背後其實是三個老工具的組合技:yt-dlp 負責下載並優先抓字幕,ffmpeg 負責把畫面抽成一張張圖片,字幕不夠時再交給 Whisper 轉逐字稿。最後這些「畫面 + 逐字稿」會一起餵給 Claude,每張圖都標了時間戳(t=MM:SS),Claude 一張張讀進去。等它回答的時候,是真的看過那些畫面、聽過那段聲音,而不是照著標題腦補。網址支援 yt-dlp 認得的幾百個站,YouTube、Loom、TikTok、X、Instagram 都可以,本地 .mp4/.mov/.mkv/.webm 也吃。

它不挑 Claude 的用法。官方支援三種安裝面:Claude Code 直接裝 plugin、claude.ai 網頁版上傳 skill 檔,甚至 Codex、Cursor、Copilot、Gemini CLI 等五十多個 agent 平台都能用同一套 npx skills 指令裝。作者是 YouTube 上做 AI 內容的 Brad Bonanno。

為什麼「讓 AI 看得見畫面」值得你停下來看?

差別在於資訊完整度。過去要 AI「幫我看片」,主流做法是丟字幕給它。字幕的問題是:它只有「說了什麼」,沒有「畫面上發生了什麼」。一段教學影片,講者說「你看這裡」的時候,字幕不會告訴你螢幕上那個按鈕在哪;一支廣告,真正的重點常常在畫面設計而不是旁白。純字幕漏掉的,往往就是最關鍵的那部分。

claude-video 兩邊都拿:它把畫面抽成圖,讓 Claude 用它的多模態能力「看」;同時保留逐字稿,讓它「聽」。這也是它跟「直接把 YouTube 連結丟給某些模型」最大的不同——那類做法多半只吃到字幕層,畫面細節還是斷的。

不會寫程式,也裝得起來嗎?

可以,這正是它做得好的地方。最省事的是 Claude Code:貼兩行指令就完成,之後還會自動更新。

/plugin marketplace add bradautomates/claude-video
/plugin install watch@claude-video

用 Cursor、Codex、Gemini CLI 這些的話,一行搞定:npx skills add bradautomates/claude-video -g-g 是裝給整個帳號用)。用 claude.ai 網頁版的人,去 release 頁下載 watch.skill,到「設定 → Capabilities → Skills」按加號拖進去,記得先把「Code execution and file creation」打開,因為它要呼叫 ffmpeg。第一次跑 /watch 時,如果你電腦沒裝 ffmpeg 或 yt-dlp,它會自己幫你裝(macOS 直接用 brew,Linux 和 Windows 會印出該複製的指令),零設定就能開始。整個過程不用你寫任何一行程式。

看一支影片要花多少 token?(成本估算器)

這是用之前最該搞懂的一件事:成本主要來自「畫面」。每一張抽出來的圖都是一張圖片,圖片 token 加起來很快。claude-video 有一套自動邏輯,會按影片長度決定抽幾張圖(30 秒的片抽約 30 張,超過 10 分鐘就封頂 100 張並跳出「稀疏掃描」警告,提醒你不如用 --start/--end 鎖一小段)。下面這個小工具幫你先抓個概念——輸入影片長度、選畫質模式,估一下大概幾張圖、多少 token:

🎬 claude-video 看片成本估算器
※ 粗估僅供抓感覺,實際依影片畫面變化、解析度與字幕長度而定。圖片 token 用 512px 寬、約 197 token/張估算。

還有一個貼心設計叫「去重」:像投影片停在同一頁 90 秒、或者靜態螢幕錄影,會抽出一堆幾乎一樣的圖,claude-video 預設會把這些近乎重複的幀丟掉,把預算花在真正不同的畫面上。要鎖一小段就加 --start 2:15 --end 2:45,那一段會抽得更密,反而更便宜、更準。

一般人到底可以拿它來幹嘛?

官方列的幾個用法,其實都很接地氣:

  • 拆別人的爆款:丟一支病毒式影片,問「他開場前十秒的 hook 是什麼結構」,Claude 會看開頭幾幀、讀開場逐字稿,幫你拆解。做內容的人拿來研究對手、廣告素材、podcast 開場特別好用。
  • 從錄影裡抓 bug:同事丟你一段螢幕錄影說「壞了」,你 /watch bug.mov 哪裡出錯,它會找到出問題那一幀、描述畫面,常常你連檔案都還沒打開它就講出原因。
  • 把長片壓成摘要:一支落落長的影片,一句「summarize this」就幫你抓結構、關鍵時刻、實際說了什麼,比你自己開 2 倍速還快。
  • 把發布會的水分擠掉:問「這支更新影片到底有什麼是真的新的,跳過那些吹捧」,它幫你把十分鐘的鋪陳砍到剩幾個重點。
  • 把一整個課程變成筆記:對一系列影片各跑一次,一個頻道或線上課就變成可搜尋的筆記,而不是幾十小時你得乖乖坐著看的內容。

從「幫自己看片」到「靠它多賺一條」

如果你正在想怎麼靠 AI 多開一條出路,這工具其實是個不錯的接口。做短影音的人,可以系統性地拆競品爆款的開場、節奏、轉場,把「看得懂為什麼紅」變成可複製的方法;接案的人,可以提供「影片重點整理/逐字稿+摘要」這種小服務,把過去要人肉看兩小時的活,變成幾分鐘一單;做知識付費的人,可以把一堆散落的教學影片整理成結構化講義。工具本身免費,你賣的是「幫人省下看片的時間」,這門生意一直都有需求。

要花錢嗎?免費到哪、付費從哪開始?

分兩塊看。工具本身、下載、抓「原生字幕」這條路——免費。大部分公開影片都有字幕(人工或自動生成),走這條完全不花錢。只有當一支影片真的沒有字幕(常見於本地檔案、部分 TikTok、少數沒字幕的 YouTube),它才會退而求其次,抽一段音訊丟給 Whisper 轉錄。這時候你要自備 API key:Groq 的 whisper-large-v3 又快又便宜(官方首選),或用 OpenAI 的 whisper-1。不想花這筆,加 --no-whisper,沒字幕時就只用畫面。至於 Claude 這邊的用量,看你原本用哪個方案,圖片 token 會照上面估算器的量計入。價格請以各家官網為準(截至 2026 年 7 月)。

有什麼限制、什麼情況不建議用?

兩個要先知道。第一,長片的準確度看模式:預設的封頂模式在超過十分鐘後,畫面會被攤得比較稀,重點畫面可能漏掉——這時要嘛用 --start/--end 鎖段落,要嘛切到不封頂的 token-burner(但 token 會噴上去)。第二,隱私要注意:如果影片沒字幕、走了 Whisper,那段音訊是會傳到 Groq 或 OpenAI 的雲端的。內部會議、機密錄影這種,建議加 --no-whisper 或先確認合規再用。另外它畢竟是抽幀,不是逐幀播放,一閃而過的細節(單幀彈出的文字)有機會被跳過,真的要摳這種細節就用 --timestamps 指定時間點抓圖。

不想用它,有別的選擇嗎?

當然有,看你的情境:只想要純文字重點、又剛好在用 Gemini,可以直接把 YouTube 連結丟給它(吃字幕層,畫面細節較弱);想做「一堆資料來源+問答」的,Google 的 NotebookLM 很順手;只是要一份逐字稿、不需要 AI 理解畫面,本地跑 whisper.cpp 或前陣子很紅的 meetily 就夠。claude-video 的甜蜜點很明確:你已經在用 Claude,而且你要的是「看得見畫面」的理解,不只是字幕。

新手三步行動清單

  • ✅ 用 Claude Code 貼那兩行指令裝好,或用 npx skills add 裝進你的 agent。
  • ✅ 找一支你本來就想看、但懶得看完的影片,跑 /watch <連結> 幫我抓重點
  • ✅ 想省 token 就先用 --detail transcript 或鎖 --start/--end,需要看畫面細節再開 balanced。

常見問題(FAQ)

claude-video 是免費的嗎?

工具本身 MIT 授權、免費開源。下載和抓原生字幕不用錢;只有影片沒字幕、要用 Whisper 轉錄時,才需要自備 Groq 或 OpenAI 的 API key,產生一小筆費用。

它跟直接把 YouTube 連結丟給 AI 有什麼不同?

最大差別是它會真的「看畫面」。直接丟連結多半只吃到字幕,畫面上發生的事會斷掉;claude-video 會抽出一張張畫面讓 Claude 讀,畫面加聲音一起理解。

不會寫程式可以用嗎?

可以。安裝就是貼指令或拖一個檔案,用起來就是一句 /watch 連結 你的問題,全程不用寫任何程式碼。ffmpeg、yt-dlp 這些底層工具第一次跑時會自動幫你裝。

會不會很花錢?

主要成本是抽出來的畫面(圖片 token)。短片很便宜,長片建議用估算器先抓個量,或用 --start/--end 鎖一小段,把預算花在你真正想看的部分。

延伸閱讀

原始碼與完整說明:github.com/bradautomates/claude-video。本文為獨立整理,claude-video 為第三方開源專案,與本站無任何贊助或利益關係。

免責聲明:本文為 AI 工具教學與資訊分享,非投資建議。文中工具的功能、定價與授權可能隨版本更新而變動,實際請以官方 GitHub 與各服務商官網為準(截至 2026 年 7 月)。使用第三方 API 轉錄影片內容前,請自行確認資料隱私與合規要求。

延伸閱讀:完整的 GitHub 熱門開源 AI 專案精選,20+ 個開源工具依用途分類收藏、持續更新。

關於Mr. Slash

「Mr. Slash 的系統性人生」,創立於 2024年,由 Mr. Slash 本人及專業編輯團隊經營的財經內容平台。

我們的宗旨是透過投資、財經、自動化與新興科技等領域的深入解說與應用,幫助讀者打造穩定的被動收入系統。內容涵蓋加密貨幣、股息資產、量化工具、平台分潤等實用策略,協助你用更聰明的方法配置資金、累積資產,走在財務自由的路上,少走冤枉路。

若為商業合作邀稿,將會清楚標註「不代表本站立場」。

商業合作

如果您有任何關於我們團隊或網站內容的疑問或建議,歡迎您前往IG 私訊 @slash.Capital聯繫我們,謝謝!

發表迴響

相關文章

最新文章

探索更多來自 Mr. Slash|系統流人生 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀

خصم دائم على الرسوم سجّل في OKX مجاناً ←
Join Mr. Slash