Kyutai 這次沒開發表會,也沒拍炫技影片。他們只是把一個叫 Pocket TTS 的東西丟上 GitHub,README 上寫著一句半開玩笑的話:「A TTS that fits in your CPU (and pocket)」——一個塞得進你 CPU(和口袋)的語音合成。結果幾週內衝到 4,100 顆星。原因很簡單:以前要一張顯示卡、一組雲端 API、一筆按字收費的帳單才做得到的「高品質語音 + 複製聲音」,現在一句 pip install 就能在你手上那台普通筆電跑起來,而且比真人講話還快 6 倍。

一句話結論:Pocket TTS 是 Kyutai 開源的 100M 參數離線語音合成,只吃 2 核 CPU、免 GPU、約 200ms 就出聲,還能用 5 秒錄音複製任何人的聲線。想在本地免費做旁白、有聲書、語音助理,這是目前最輕的起點。

截至 2026 年 7 月。AI 工具更新很快,本文提到的版本(v2.0.0)、規格與各平台價格請以官方為準。

Pocket TTS 到底是什麼?

它是法國 AI 實驗室 Kyutai Labs 開源的文字轉語音(TTS,Text-to-Speech)模型,用 MIT 授權,程式碼、模型權重全部公開,商用也免費。跟你熟悉的雲端服務(ElevenLabs、OpenAI TTS)最大的差別在於:它不上雲、不連網、不按字收費,整包連模型只有大約 300MB,跑在你自己的 CPU 上,資料一個位元組都不會離開你的電腦。

規格聽起來會讓人懷疑是不是打錯字:模型只有 1 億參數(100M),執行時只用到 2 個 CPU 核心,第一段聲音大約 200 毫秒就吐出來,整體生成速度是即時語速的 6 倍(在 MacBook Air M4 的 CPU 上實測)。它還能串流輸出、處理無限長的文字、支援英、法、德、葡、義、西 6 種語言,並且能在瀏覽器裡用 WebAssembly 直接跑。作者群是 Kyutai 的 Manu Orsini、Simon Rouard、Gabriel De Marmiesse 等人,跟做出 Moshi 的是同一批人。

比一比Pocket TTS(本地)雲端 TTS(ElevenLabs / OpenAI)傳統本地大模型 TTS
硬體門檻普通 CPU,免 GPU不用,算力在對方通常要 GPU、幾 GB 顯存
費用免費(開源)按字數 / 訂閱計費免費,但吃電吃硬體
資料隱私100% 留在本機文字送上雲端留在本機
首段延遲約 200ms看網速,常 1 秒以上常要等整句算完
複製聲音5 秒錄音、零訓練要上傳樣本 / 付費方案多半要幾分鐘樣本 + 微調
檔案大小約 300MB不用下載常 2GB 以上

為什麼它能塞進 CPU 還跑得這麼快?

關鍵在架構換了想法。多數 AI 語音模型走「離散 token」路線:把聲音切成一小塊一小塊,讓模型一顆一顆去猜,運算很重,銜接也容易有機械感。Pocket TTS 改用 Kyutai 自己的 CALM(Continuous Audio Language Model,連續音訊語言模型),把聲音當成一條連續流動的波,用一步到位的一致性模型直接預測「聲音怎麼流」,省掉最耗算力的那一段。

打個比方:傳統雲端 TTS 像叫一台水罐車。你只想喝一口水,卻要等一台大卡車從倉庫(雲端)開到你家。Pocket TTS 比較像水龍頭——它已經裝在你家的水管(你的 CPU)裡,把手一扭水就流出來,而且不是等一整桶裝滿才給你,而是一段一段連續送,你可以馬上開始聽。有趣的是,Kyutai 試過把它放到 GPU 上跑,發現幾乎沒有變快,因為模型實在太小、批次又只有 1,CPU 已經夠用。這也是它敢叫「Pocket」的底氣。

5 秒複製一個人的聲音,是真的嗎?

是真的,而且不用「訓練」。傳統聲音複製要幾小時錄音、再花幾天微調模型;Pocket TTS 只要一段大約 5 到 10 秒的 .wav 檔,就能抽出一組「聲音指紋」(voice embedding)——音色、口音、甚至房間的殘響都會被記下來,再套到你要它唸的文字上。內建也附了 20 幾把預設聲線(alba、anna、charles 之類),想直接用不用自己錄。

有兩個現實要先講清楚。第一,它連樣本裡的雜訊都會一起複製,所以拿去複製的那段錄音一定要乾淨,背景有冷氣聲、回音,出來的語音就會帶著同樣的底噪。第二,也是更重要的一點:Kyutai 在授權裡明文禁止未經當事人同意複製他人聲音、以及任何拿來詐騙或假冒的用途。技術門檻歸零之後,守規矩就變成你自己的責任。用自己的聲音、或有授權的聲音,別去碰別人的。

不會寫程式,怎麼在自己電腦上跑?

最快的方式其實是零安裝:打開 kyutai.org/pocket-tts,直接在瀏覽器輸入文字、選聲線、生成、下載,先玩過再決定要不要裝。想在本機跑,也只有三步,零基礎也能照做(只要電腦有 Python 3.10 以上):

  1. 裝好套件管理器 uv(官方推薦,會自動處理相依套件,不用自己搞環境)。
  2. 生成一段語音:在終端機打 uvx pocket-tts generate --text "哈囉,這是我的第一段語音" --voice alba,它會在資料夾裡吐出一個 wav 檔,還順便印出速度統計。
  3. 開一個本地小網頁來玩:打 uvx pocket-tts serve,然後瀏覽器開 http://localhost:8000,就有一個可以換聲線、貼文字、上傳自己錄音來複製聲音的介面,因為模型一直在記憶體裡,比命令列還快。

如果你是開發者、想把它接進自己的程式,Python API 也很精簡:load_model() 載入模型、get_state_for_audio_prompt() 選聲線或餵一段錄音、generate_audio() 生成,三行就出聲。載入模型跟處理聲音樣本這兩步比較慢,官方建議把模型留在記憶體、把常用聲線先用 export-voice 轉成 safetensors 檔,之後載入就是一瞬間的事。

Pocket TTS 跟雲端 TTS 差在哪?該選哪個?

差在你把「品質天花板」和「掌控權」哪個看得比較重。純論音質的細膩度和情緒表現,ElevenLabs 這類雲端頂規還是領先,畢竟人家跑的是大模型。但只要你的需求是「量大、要壓成本、資料不想外流、想離線隨時用」,Pocket TTS 的性價比幾乎沒有對手——它免費、在本機、按下去就有,而且量再大也不會多收你一毛錢。

下面這個小工具幫你把帳算清楚。填你每個月大概要生成多少字的語音、再填一個你參考的雲端單價,它會算出一年下來雲端要付多少、而 Pocket TTS 的軟體成本是零:

🧮 雲端 TTS vs Pocket TTS 一年成本試算

試算僅供參考,雲端價格各平台與方案不同,請以官網為準(截至 2026 年 7 月)。Pocket TTS 為開源軟體,成本為 $0,另需自備電腦硬體與電力。

它有什麼限制?哪些人先別急著換?

它不是萬能,官方自己也很老實地列了短板。目前你沒辦法在文字裡手動插入停頓或靜音來控制節奏;還沒支援 int8 量化,所以沒法再進一步壓運算;載入模型、匯出聲線這幾個「準備動作」偏慢,所以你得把模型留在記憶體裡才維持得住速度。語言方面現在是 6 種,中文還沒進官方支援,要做中文旁白目前得另尋方案。如果你追求的是廣告等級、帶細膩情緒起伏的商用配音,雲端頂規仍然更穩。但只要是「大量、日常、內部、要離線」的語音需求,這些限制多半你根本不會踩到。

內容創作者可以拿它做什麼、甚至賺什麼?

這才是對做自媒體、想多一條出路的人最實際的部分。一個免費、離線、能複製聲音又快的 TTS,等於把過去要花錢外包的語音工序整條搬回你桌面。幾個馬上能落地的方向:

  • 影片旁白量產:短影音、知識型頻道的口白不用再一條條配音或付月費,腳本貼進去就出聲,改稿重生也免費。
  • 有聲書 / Podcast 草稿:把文章、電子書轉成語音,社群上已經有人拿它接成「有聲書工具」,一鍵把長文變音檔。
  • 本地語音助理:它能接 Home Assistant(透過 Wyoming 協定)、Discord 機器人、甚至有人做成 OpenAI 相容的串流伺服器,讓你的 AI agent 開口說話,全程不上雲。這一塊可以延伸讀我們寫過的 Dify 建 AI 應用教學,把語音接到你自己的 agent。
  • 接案服務化:已經有人把它包成「20 秒複製聲音 + OpenAI 相容 API」的伺服器。你可以用同一套邏輯,替中小商家做客製語音(在取得授權的前提下),把免費工具變成一項收費服務。

邏輯跟我們一直講的一樣:工具本身免費不稀奇,稀奇的是你把「省下來的成本」翻成「一條能收錢的服務」。想走本地、省錢、保護資料這條路,可以順著讀我們實測過的 Ollama 本地跑 LLMMeetily 100% 本地 AI 會議記錄,跟 Pocket TTS 是同一套「把 AI 搬回自己機器」的思路。

如果 Pocket TTS 不適合我,有什麼替代方案?

看你缺的是哪一塊。要中文、要頂級情緒配音,就往雲端的 ElevenLabs、OpenAI TTS 走,音質換金錢與隱私。想留在本地又要更多語言,可以看 Kokoro TTS(輕量、開源,但沒有 5 秒零樣本複製這種強項);要更強的聲音複製、不介意吃 GPU,就試 XTTS / Coqui 這類較重的方案。想要 Kyutai 同一家更高品質的版本,他們也有需要 GPU 的完整版 TTS。同樣做「把大模型搬回本地」的思路,也可以參考我們寫的 阿里 zvec 塞進 App 的向量資料庫,和 讓 Claude 看影片的開源指令

新手行動清單(照做就上手)

  • ✅ 先開 kyutai.org/pocket-tts 網頁版,不用安裝,貼段文字試聽音質。
  • ✅ 覺得可以,電腦裝好 uv,跑 uvx pocket-tts serve 開本地介面。
  • ✅ 用一段 5 秒、乾淨的自己錄音,試試看聲音複製效果。
  • ✅ 把常用聲線用 export-voice 存起來,之後載入秒開。
  • ✅ 想接產品,用 Python API 三行接進你的 app 或語音助理。
  • ✅ 動手前先確認:只複製自己或有授權的聲音,別碰別人的。

常見問題 FAQ

Pocket TTS 真的完全免費嗎?

軟體本身用 MIT 授權,完全開源、商用免費,沒有按字收費。你唯一的成本是自己的電腦硬體與電力,跑一次不會再向任何雲端付錢。

沒有 GPU、只有一台普通筆電也能跑嗎?

可以,這正是它的賣點。模型只有 100M 參數、只用 2 個 CPU 核心,官方測過放 GPU 也不會更快。只要有 Python 3.10 以上與 PyTorch 2.5+,一般筆電就跑得動。

Pocket TTS 支援中文嗎?

截至 2026 年 7 月,官方支援英、法、德、葡、義、西 6 種語言,中文還沒進官方名單。要做中文語音,目前得先用雲端服務或其他支援中文的開源方案。

用它複製別人的聲音合法嗎?

Kyutai 授權明文禁止未經同意複製他人聲音,以及任何詐騙、假冒用途。請只用自己的聲音或已取得授權的聲音,這是你使用時的法律責任。

免責聲明:本文為技術資訊整理與個人使用心得,非投資或商業建議。文中工具規格、版本與價格截至 2026 年 7 月,實際以官方為準。使用任何語音複製技術請遵守當地法律與平台授權條款,切勿未經同意複製他人聲音。本站不因讀者依本文操作所生之任何結果負責。

延伸閱讀:站內相關文章

關於Mr. Slash

「Mr. Slash 的系統性人生」,創立於 2024年,由 Mr. Slash 本人及專業編輯團隊經營的財經內容平台。

我們的宗旨是透過投資、財經、自動化與新興科技等領域的深入解說與應用,幫助讀者打造穩定的被動收入系統。內容涵蓋加密貨幣、股息資產、量化工具、平台分潤等實用策略,協助你用更聰明的方法配置資金、累積資產,走在財務自由的路上,少走冤枉路。

若為商業合作邀稿,將會清楚標註「不代表本站立場」。

商業合作

如果您有任何關於我們團隊或網站內容的疑問或建議,歡迎您前往IG 私訊 @slash.Capital聯繫我們,謝謝!

عن Mr. Slash

«Mr. Slash» منصة محتوى مالي تأسست عام 2024، يديرها فريق تحرير متخصص. نقدّم للقارئ العربي شروحات عملية ومحايدة عن العملات الرقمية وطرق الشراء والإيداع والسحب المحلية في السعودية ومصر والخليج.

هدفنا مساعدتك على فهم السوق واختيار منصة تداول موثوقة وتقليل الرسوم. نحن لا نقدّم نصيحة استثمارية والقرار النهائي يبقى لك؛ وفي حال التعاون التجاري يُوضَّح ذلك صراحةً ولا يمثّل رأي الموقع.

تواصل وتعاون تجاري

لأي استفسار أو اقتراح أو تعاون، تواصل معنا عبر إنستغرام @slash.Capital. شكرًا لك!

發表迴響

相關文章

مقالات ذات صلة

Trending

探索更多來自 Mr. Slash|系統流人生 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀

خصم دائم على الرسوم سجّل في OKX مجاناً ←
Join Mr. Slash