Claude 這一年愈來愈全能:它會讀網頁、會跑腳本、會翻整個 GitHub repo。但有一件事,它出廠時其實做不到——看影片。你貼一條 YouTube 連結給它,它多半只能靠標題猜,或者去撈一份缺了九成畫面的字幕。你問「他在第 30 秒做了什麼手勢」,它其實沒看過那一幀,只能裝作看過。

最近在 GitHub 竄起的開源工具 claude-video(一個叫 /watch 的指令)就是來補這個洞的。它今天單日新增四百多顆星,做的事情很直白:貼一條影片連結,Claude 就會自己下載、抽出畫面、轉出逐字稿,然後「連看帶聽」把整條片吃進去,再回答你的問題。截至 2026 年 7 月,它是 MIT 授權、完全免費。

一句話結論:claude-video 是一個開源指令 /watch,讓 Claude 自動下載影片、抽格、轉逐字稿,真正「看完」任何 YouTube 或本地影片再回答你,不用寫程式,captions 有的話全程免費。

claude-video 到底是什麼?

它是一個裝在 Claude 上的「技能(skill)」,核心就是一個指令:/watch。用法長這樣——你丟一條網址或一個本地檔案路徑,再問一個問題:

/watch https://youtu.be/xxxxxxxx 他開場用了什麼 hook?

背後其實是三個老工具的組合技:yt-dlp 負責下載並優先抓字幕,ffmpeg 負責把畫面抽成一張張圖片,字幕不夠時再交給 Whisper 轉逐字稿。最後這些「畫面 + 逐字稿」會一起餵給 Claude,每張圖都標了時間戳(t=MM:SS),Claude 一張張讀進去。等它回答的時候,是真的看過那些畫面、聽過那段聲音,而不是照著標題腦補。網址支援 yt-dlp 認得的幾百個站,YouTube、Loom、TikTok、X、Instagram 都可以,本地 .mp4/.mov/.mkv/.webm 也吃。

它不挑 Claude 的用法。官方支援三種安裝面:Claude Code 直接裝 plugin、claude.ai 網頁版上傳 skill 檔,甚至 Codex、Cursor、Copilot、Gemini CLI 等五十多個 agent 平台都能用同一套 npx skills 指令裝。作者是 YouTube 上做 AI 內容的 Brad Bonanno。

為什麼「讓 AI 看得見畫面」值得你停下來看?

差別在於資訊完整度。過去要 AI「幫我看片」,主流做法是丟字幕給它。字幕的問題是:它只有「說了什麼」,沒有「畫面上發生了什麼」。一段教學影片,講者說「你看這裡」的時候,字幕不會告訴你螢幕上那個按鈕在哪;一支廣告,真正的重點常常在畫面設計而不是旁白。純字幕漏掉的,往往就是最關鍵的那部分。

claude-video 兩邊都拿:它把畫面抽成圖,讓 Claude 用它的多模態能力「看」;同時保留逐字稿,讓它「聽」。這也是它跟「直接把 YouTube 連結丟給某些模型」最大的不同——那類做法多半只吃到字幕層,畫面細節還是斷的。

不會寫程式,也裝得起來嗎?

可以,這正是它做得好的地方。最省事的是 Claude Code:貼兩行指令就完成,之後還會自動更新。

/plugin marketplace add bradautomates/claude-video
/plugin install watch@claude-video

用 Cursor、Codex、Gemini CLI 這些的話,一行搞定:npx skills add bradautomates/claude-video -g-g 是裝給整個帳號用)。用 claude.ai 網頁版的人,去 release 頁下載 watch.skill,到「設定 → Capabilities → Skills」按加號拖進去,記得先把「Code execution and file creation」打開,因為它要呼叫 ffmpeg。第一次跑 /watch 時,如果你電腦沒裝 ffmpeg 或 yt-dlp,它會自己幫你裝(macOS 直接用 brew,Linux 和 Windows 會印出該複製的指令),零設定就能開始。整個過程不用你寫任何一行程式。

看一支影片要花多少 token?(成本估算器)

這是用之前最該搞懂的一件事:成本主要來自「畫面」。每一張抽出來的圖都是一張圖片,圖片 token 加起來很快。claude-video 有一套自動邏輯,會按影片長度決定抽幾張圖(30 秒的片抽約 30 張,超過 10 分鐘就封頂 100 張並跳出「稀疏掃描」警告,提醒你不如用 --start/--end 鎖一小段)。下面這個小工具幫你先抓個概念——輸入影片長度、選畫質模式,估一下大概幾張圖、多少 token:

🎬 claude-video 看片成本估算器
※ 粗估僅供抓感覺,實際依影片畫面變化、解析度與字幕長度而定。圖片 token 用 512px 寬、約 197 token/張估算。

還有一個貼心設計叫「去重」:像投影片停在同一頁 90 秒、或者靜態螢幕錄影,會抽出一堆幾乎一樣的圖,claude-video 預設會把這些近乎重複的幀丟掉,把預算花在真正不同的畫面上。要鎖一小段就加 --start 2:15 --end 2:45,那一段會抽得更密,反而更便宜、更準。

一般人到底可以拿它來幹嘛?

官方列的幾個用法,其實都很接地氣:

  • 拆別人的爆款:丟一支病毒式影片,問「他開場前十秒的 hook 是什麼結構」,Claude 會看開頭幾幀、讀開場逐字稿,幫你拆解。做內容的人拿來研究對手、廣告素材、podcast 開場特別好用。
  • 從錄影裡抓 bug:同事丟你一段螢幕錄影說「壞了」,你 /watch bug.mov 哪裡出錯,它會找到出問題那一幀、描述畫面,常常你連檔案都還沒打開它就講出原因。
  • 把長片壓成摘要:一支落落長的影片,一句「summarize this」就幫你抓結構、關鍵時刻、實際說了什麼,比你自己開 2 倍速還快。
  • 把發布會的水分擠掉:問「這支更新影片到底有什麼是真的新的,跳過那些吹捧」,它幫你把十分鐘的鋪陳砍到剩幾個重點。
  • 把一整個課程變成筆記:對一系列影片各跑一次,一個頻道或線上課就變成可搜尋的筆記,而不是幾十小時你得乖乖坐著看的內容。

從「幫自己看片」到「靠它多賺一條」

如果你正在想怎麼靠 AI 多開一條出路,這工具其實是個不錯的接口。做短影音的人,可以系統性地拆競品爆款的開場、節奏、轉場,把「看得懂為什麼紅」變成可複製的方法;接案的人,可以提供「影片重點整理/逐字稿+摘要」這種小服務,把過去要人肉看兩小時的活,變成幾分鐘一單;做知識付費的人,可以把一堆散落的教學影片整理成結構化講義。工具本身免費,你賣的是「幫人省下看片的時間」,這門生意一直都有需求。

要花錢嗎?免費到哪、付費從哪開始?

分兩塊看。工具本身、下載、抓「原生字幕」這條路——免費。大部分公開影片都有字幕(人工或自動生成),走這條完全不花錢。只有當一支影片真的沒有字幕(常見於本地檔案、部分 TikTok、少數沒字幕的 YouTube),它才會退而求其次,抽一段音訊丟給 Whisper 轉錄。這時候你要自備 API key:Groq 的 whisper-large-v3 又快又便宜(官方首選),或用 OpenAI 的 whisper-1。不想花這筆,加 --no-whisper,沒字幕時就只用畫面。至於 Claude 這邊的用量,看你原本用哪個方案,圖片 token 會照上面估算器的量計入。價格請以各家官網為準(截至 2026 年 7 月)。

有什麼限制、什麼情況不建議用?

兩個要先知道。第一,長片的準確度看模式:預設的封頂模式在超過十分鐘後,畫面會被攤得比較稀,重點畫面可能漏掉——這時要嘛用 --start/--end 鎖段落,要嘛切到不封頂的 token-burner(但 token 會噴上去)。第二,隱私要注意:如果影片沒字幕、走了 Whisper,那段音訊是會傳到 Groq 或 OpenAI 的雲端的。內部會議、機密錄影這種,建議加 --no-whisper 或先確認合規再用。另外它畢竟是抽幀,不是逐幀播放,一閃而過的細節(單幀彈出的文字)有機會被跳過,真的要摳這種細節就用 --timestamps 指定時間點抓圖。

不想用它,有別的選擇嗎?

當然有,看你的情境:只想要純文字重點、又剛好在用 Gemini,可以直接把 YouTube 連結丟給它(吃字幕層,畫面細節較弱);想做「一堆資料來源+問答」的,Google 的 NotebookLM 很順手;只是要一份逐字稿、不需要 AI 理解畫面,本地跑 whisper.cpp 或前陣子很紅的 meetily 就夠。claude-video 的甜蜜點很明確:你已經在用 Claude,而且你要的是「看得見畫面」的理解,不只是字幕。

新手三步行動清單

  • ✅ 用 Claude Code 貼那兩行指令裝好,或用 npx skills add 裝進你的 agent。
  • ✅ 找一支你本來就想看、但懶得看完的影片,跑 /watch <連結> 幫我抓重點
  • ✅ 想省 token 就先用 --detail transcript 或鎖 --start/--end,需要看畫面細節再開 balanced。

常見問題(FAQ)

claude-video 是免費的嗎?

工具本身 MIT 授權、免費開源。下載和抓原生字幕不用錢;只有影片沒字幕、要用 Whisper 轉錄時,才需要自備 Groq 或 OpenAI 的 API key,產生一小筆費用。

它跟直接把 YouTube 連結丟給 AI 有什麼不同?

最大差別是它會真的「看畫面」。直接丟連結多半只吃到字幕,畫面上發生的事會斷掉;claude-video 會抽出一張張畫面讓 Claude 讀,畫面加聲音一起理解。

不會寫程式可以用嗎?

可以。安裝就是貼指令或拖一個檔案,用起來就是一句 /watch 連結 你的問題,全程不用寫任何程式碼。ffmpeg、yt-dlp 這些底層工具第一次跑時會自動幫你裝。

會不會很花錢?

主要成本是抽出來的畫面(圖片 token)。短片很便宜,長片建議用估算器先抓個量,或用 --start/--end 鎖一小段,把預算花在你真正想看的部分。

延伸閱讀

原始碼與完整說明:github.com/bradautomates/claude-video。本文為獨立整理,claude-video 為第三方開源專案,與本站無任何贊助或利益關係。

免責聲明:本文為 AI 工具教學與資訊分享,非投資建議。文中工具的功能、定價與授權可能隨版本更新而變動,實際請以官方 GitHub 與各服務商官網為準(截至 2026 年 7 月)。使用第三方 API 轉錄影片內容前,請自行確認資料隱私與合規要求。

延伸閱讀:完整的 GitHub 熱門開源 AI 專案精選,20+ 個開源工具依用途分類收藏、持續更新。

關於Mr. Slash

「Mr. Slash 的系統性人生」,創立於 2024年,由 Mr. Slash 本人及專業編輯團隊經營的財經內容平台。

我們的宗旨是透過投資、財經、自動化與新興科技等領域的深入解說與應用,幫助讀者打造穩定的被動收入系統。內容涵蓋加密貨幣、股息資產、量化工具、平台分潤等實用策略,協助你用更聰明的方法配置資金、累積資產,走在財務自由的路上,少走冤枉路。

若為商業合作邀稿,將會清楚標註「不代表本站立場」。

商業合作

如果您有任何關於我們團隊或網站內容的疑問或建議,歡迎您前往IG 私訊 @slash.Capital聯繫我們,謝謝!

عن Mr. Slash

«Mr. Slash» منصة محتوى مالي تأسست عام 2024، يديرها فريق تحرير متخصص. نقدّم للقارئ العربي شروحات عملية ومحايدة عن العملات الرقمية وطرق الشراء والإيداع والسحب المحلية في السعودية ومصر والخليج.

هدفنا مساعدتك على فهم السوق واختيار منصة تداول موثوقة وتقليل الرسوم. نحن لا نقدّم نصيحة استثمارية والقرار النهائي يبقى لك؛ وفي حال التعاون التجاري يُوضَّح ذلك صراحةً ولا يمثّل رأي الموقع.

تواصل وتعاون تجاري

لأي استفسار أو اقتراح أو تعاون، تواصل معنا عبر إنستغرام @slash.Capital. شكرًا لك!

發表迴響

相關文章

مقالات ذات صلة

Trending

探索更多來自 Mr. Slash|系統流人生 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀

خصم دائم على الرسوم سجّل في OKX مجاناً ←
Join Mr. Slash