Kyutai 這次沒開發表會,也沒拍炫技影片。他們只是把一個叫 Pocket TTS 的東西丟上 GitHub,README 上寫著一句半開玩笑的話:「A TTS that fits in your CPU (and pocket)」——一個塞得進你 CPU(和口袋)的語音合成。結果幾週內衝到 4,100 顆星。原因很簡單:以前要一張顯示卡、一組雲端 API、一筆按字收費的帳單才做得到的「高品質語音 + 複製聲音」,現在一句 pip install 就能在你手上那台普通筆電跑起來,而且比真人講話還快 6 倍。

一句話結論:Pocket TTS 是 Kyutai 開源的 100M 參數離線語音合成,只吃 2 核 CPU、免 GPU、約 200ms 就出聲,還能用 5 秒錄音複製任何人的聲線。想在本地免費做旁白、有聲書、語音助理,這是目前最輕的起點。

截至 2026 年 7 月。AI 工具更新很快,本文提到的版本(v2.0.0)、規格與各平台價格請以官方為準。

Pocket TTS 到底是什麼?

它是法國 AI 實驗室 Kyutai Labs 開源的文字轉語音(TTS,Text-to-Speech)模型,用 MIT 授權,程式碼、模型權重全部公開,商用也免費。跟你熟悉的雲端服務(ElevenLabs、OpenAI TTS)最大的差別在於:它不上雲、不連網、不按字收費,整包連模型只有大約 300MB,跑在你自己的 CPU 上,資料一個位元組都不會離開你的電腦。

規格聽起來會讓人懷疑是不是打錯字:模型只有 1 億參數(100M),執行時只用到 2 個 CPU 核心,第一段聲音大約 200 毫秒就吐出來,整體生成速度是即時語速的 6 倍(在 MacBook Air M4 的 CPU 上實測)。它還能串流輸出、處理無限長的文字、支援英、法、德、葡、義、西 6 種語言,並且能在瀏覽器裡用 WebAssembly 直接跑。作者群是 Kyutai 的 Manu Orsini、Simon Rouard、Gabriel De Marmiesse 等人,跟做出 Moshi 的是同一批人。

比一比Pocket TTS(本地)雲端 TTS(ElevenLabs / OpenAI)傳統本地大模型 TTS
硬體門檻普通 CPU,免 GPU不用,算力在對方通常要 GPU、幾 GB 顯存
費用免費(開源)按字數 / 訂閱計費免費,但吃電吃硬體
資料隱私100% 留在本機文字送上雲端留在本機
首段延遲約 200ms看網速,常 1 秒以上常要等整句算完
複製聲音5 秒錄音、零訓練要上傳樣本 / 付費方案多半要幾分鐘樣本 + 微調
檔案大小約 300MB不用下載常 2GB 以上

為什麼它能塞進 CPU 還跑得這麼快?

關鍵在架構換了想法。多數 AI 語音模型走「離散 token」路線:把聲音切成一小塊一小塊,讓模型一顆一顆去猜,運算很重,銜接也容易有機械感。Pocket TTS 改用 Kyutai 自己的 CALM(Continuous Audio Language Model,連續音訊語言模型),把聲音當成一條連續流動的波,用一步到位的一致性模型直接預測「聲音怎麼流」,省掉最耗算力的那一段。

打個比方:傳統雲端 TTS 像叫一台水罐車。你只想喝一口水,卻要等一台大卡車從倉庫(雲端)開到你家。Pocket TTS 比較像水龍頭——它已經裝在你家的水管(你的 CPU)裡,把手一扭水就流出來,而且不是等一整桶裝滿才給你,而是一段一段連續送,你可以馬上開始聽。有趣的是,Kyutai 試過把它放到 GPU 上跑,發現幾乎沒有變快,因為模型實在太小、批次又只有 1,CPU 已經夠用。這也是它敢叫「Pocket」的底氣。

5 秒複製一個人的聲音,是真的嗎?

是真的,而且不用「訓練」。傳統聲音複製要幾小時錄音、再花幾天微調模型;Pocket TTS 只要一段大約 5 到 10 秒的 .wav 檔,就能抽出一組「聲音指紋」(voice embedding)——音色、口音、甚至房間的殘響都會被記下來,再套到你要它唸的文字上。內建也附了 20 幾把預設聲線(alba、anna、charles 之類),想直接用不用自己錄。

有兩個現實要先講清楚。第一,它連樣本裡的雜訊都會一起複製,所以拿去複製的那段錄音一定要乾淨,背景有冷氣聲、回音,出來的語音就會帶著同樣的底噪。第二,也是更重要的一點:Kyutai 在授權裡明文禁止未經當事人同意複製他人聲音、以及任何拿來詐騙或假冒的用途。技術門檻歸零之後,守規矩就變成你自己的責任。用自己的聲音、或有授權的聲音,別去碰別人的。

不會寫程式,怎麼在自己電腦上跑?

最快的方式其實是零安裝:打開 kyutai.org/pocket-tts,直接在瀏覽器輸入文字、選聲線、生成、下載,先玩過再決定要不要裝。想在本機跑,也只有三步,零基礎也能照做(只要電腦有 Python 3.10 以上):

  1. 裝好套件管理器 uv(官方推薦,會自動處理相依套件,不用自己搞環境)。
  2. 生成一段語音:在終端機打 uvx pocket-tts generate --text "哈囉,這是我的第一段語音" --voice alba,它會在資料夾裡吐出一個 wav 檔,還順便印出速度統計。
  3. 開一個本地小網頁來玩:打 uvx pocket-tts serve,然後瀏覽器開 http://localhost:8000,就有一個可以換聲線、貼文字、上傳自己錄音來複製聲音的介面,因為模型一直在記憶體裡,比命令列還快。

如果你是開發者、想把它接進自己的程式,Python API 也很精簡:load_model() 載入模型、get_state_for_audio_prompt() 選聲線或餵一段錄音、generate_audio() 生成,三行就出聲。載入模型跟處理聲音樣本這兩步比較慢,官方建議把模型留在記憶體、把常用聲線先用 export-voice 轉成 safetensors 檔,之後載入就是一瞬間的事。

Pocket TTS 跟雲端 TTS 差在哪?該選哪個?

差在你把「品質天花板」和「掌控權」哪個看得比較重。純論音質的細膩度和情緒表現,ElevenLabs 這類雲端頂規還是領先,畢竟人家跑的是大模型。但只要你的需求是「量大、要壓成本、資料不想外流、想離線隨時用」,Pocket TTS 的性價比幾乎沒有對手——它免費、在本機、按下去就有,而且量再大也不會多收你一毛錢。

下面這個小工具幫你把帳算清楚。填你每個月大概要生成多少字的語音、再填一個你參考的雲端單價,它會算出一年下來雲端要付多少、而 Pocket TTS 的軟體成本是零:

🧮 雲端 TTS vs Pocket TTS 一年成本試算

試算僅供參考,雲端價格各平台與方案不同,請以官網為準(截至 2026 年 7 月)。Pocket TTS 為開源軟體,成本為 $0,另需自備電腦硬體與電力。

它有什麼限制?哪些人先別急著換?

它不是萬能,官方自己也很老實地列了短板。目前你沒辦法在文字裡手動插入停頓或靜音來控制節奏;還沒支援 int8 量化,所以沒法再進一步壓運算;載入模型、匯出聲線這幾個「準備動作」偏慢,所以你得把模型留在記憶體裡才維持得住速度。語言方面現在是 6 種,中文還沒進官方支援,要做中文旁白目前得另尋方案。如果你追求的是廣告等級、帶細膩情緒起伏的商用配音,雲端頂規仍然更穩。但只要是「大量、日常、內部、要離線」的語音需求,這些限制多半你根本不會踩到。

內容創作者可以拿它做什麼、甚至賺什麼?

這才是對做自媒體、想多一條出路的人最實際的部分。一個免費、離線、能複製聲音又快的 TTS,等於把過去要花錢外包的語音工序整條搬回你桌面。幾個馬上能落地的方向:

  • 影片旁白量產:短影音、知識型頻道的口白不用再一條條配音或付月費,腳本貼進去就出聲,改稿重生也免費。
  • 有聲書 / Podcast 草稿:把文章、電子書轉成語音,社群上已經有人拿它接成「有聲書工具」,一鍵把長文變音檔。
  • 本地語音助理:它能接 Home Assistant(透過 Wyoming 協定)、Discord 機器人、甚至有人做成 OpenAI 相容的串流伺服器,讓你的 AI agent 開口說話,全程不上雲。這一塊可以延伸讀我們寫過的 Dify 建 AI 應用教學,把語音接到你自己的 agent。
  • 接案服務化:已經有人把它包成「20 秒複製聲音 + OpenAI 相容 API」的伺服器。你可以用同一套邏輯,替中小商家做客製語音(在取得授權的前提下),把免費工具變成一項收費服務。

邏輯跟我們一直講的一樣:工具本身免費不稀奇,稀奇的是你把「省下來的成本」翻成「一條能收錢的服務」。想走本地、省錢、保護資料這條路,可以順著讀我們實測過的 Ollama 本地跑 LLMMeetily 100% 本地 AI 會議記錄,跟 Pocket TTS 是同一套「把 AI 搬回自己機器」的思路。

如果 Pocket TTS 不適合我,有什麼替代方案?

看你缺的是哪一塊。要中文、要頂級情緒配音,就往雲端的 ElevenLabs、OpenAI TTS 走,音質換金錢與隱私。想留在本地又要更多語言,可以看 Kokoro TTS(輕量、開源,但沒有 5 秒零樣本複製這種強項);要更強的聲音複製、不介意吃 GPU,就試 XTTS / Coqui 這類較重的方案。想要 Kyutai 同一家更高品質的版本,他們也有需要 GPU 的完整版 TTS。同樣做「把大模型搬回本地」的思路,也可以參考我們寫的 阿里 zvec 塞進 App 的向量資料庫,和 讓 Claude 看影片的開源指令

新手行動清單(照做就上手)

  • ✅ 先開 kyutai.org/pocket-tts 網頁版,不用安裝,貼段文字試聽音質。
  • ✅ 覺得可以,電腦裝好 uv,跑 uvx pocket-tts serve 開本地介面。
  • ✅ 用一段 5 秒、乾淨的自己錄音,試試看聲音複製效果。
  • ✅ 把常用聲線用 export-voice 存起來,之後載入秒開。
  • ✅ 想接產品,用 Python API 三行接進你的 app 或語音助理。
  • ✅ 動手前先確認:只複製自己或有授權的聲音,別碰別人的。

常見問題 FAQ

Pocket TTS 真的完全免費嗎?

軟體本身用 MIT 授權,完全開源、商用免費,沒有按字收費。你唯一的成本是自己的電腦硬體與電力,跑一次不會再向任何雲端付錢。

沒有 GPU、只有一台普通筆電也能跑嗎?

可以,這正是它的賣點。模型只有 100M 參數、只用 2 個 CPU 核心,官方測過放 GPU 也不會更快。只要有 Python 3.10 以上與 PyTorch 2.5+,一般筆電就跑得動。

Pocket TTS 支援中文嗎?

截至 2026 年 7 月,官方支援英、法、德、葡、義、西 6 種語言,中文還沒進官方名單。要做中文語音,目前得先用雲端服務或其他支援中文的開源方案。

用它複製別人的聲音合法嗎?

Kyutai 授權明文禁止未經同意複製他人聲音,以及任何詐騙、假冒用途。請只用自己的聲音或已取得授權的聲音,這是你使用時的法律責任。

免責聲明:本文為技術資訊整理與個人使用心得,非投資或商業建議。文中工具規格、版本與價格截至 2026 年 7 月,實際以官方為準。使用任何語音複製技術請遵守當地法律與平台授權條款,切勿未經同意複製他人聲音。本站不因讀者依本文操作所生之任何結果負責。

延伸閱讀:站內相關文章

關於Mr. Slash

「Mr. Slash 的系統性人生」,創立於 2024年,由 Mr. Slash 本人及專業編輯團隊經營的財經內容平台。

我們的宗旨是透過投資、財經、自動化與新興科技等領域的深入解說與應用,幫助讀者打造穩定的被動收入系統。內容涵蓋加密貨幣、股息資產、量化工具、平台分潤等實用策略,協助你用更聰明的方法配置資金、累積資產,走在財務自由的路上,少走冤枉路。

若為商業合作邀稿,將會清楚標註「不代表本站立場」。

商業合作

如果您有任何關於我們團隊或網站內容的疑問或建議,歡迎您前往IG 私訊 @slash.Capital聯繫我們,謝謝!

發表迴響

相關文章

最新文章

探索更多來自 Mr. Slash|系統流人生 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀

خصم دائم على الرسوم سجّل في OKX مجاناً ←
Join Mr. Slash