Kyutai 這次沒開發表會,也沒拍炫技影片。他們只是把一個叫 Pocket TTS 的東西丟上 GitHub,README 上寫著一句半開玩笑的話:「A TTS that fits in your CPU (and pocket)」——一個塞得進你 CPU(和口袋)的語音合成。結果幾週內衝到 4,100 顆星。原因很簡單:以前要一張顯示卡、一組雲端 API、一筆按字收費的帳單才做得到的「高品質語音 + 複製聲音」,現在一句 pip install 就能在你手上那台普通筆電跑起來,而且比真人講話還快 6 倍。
一句話結論:Pocket TTS 是 Kyutai 開源的 100M 參數離線語音合成,只吃 2 核 CPU、免 GPU、約 200ms 就出聲,還能用 5 秒錄音複製任何人的聲線。想在本地免費做旁白、有聲書、語音助理,這是目前最輕的起點。
截至 2026 年 7 月。AI 工具更新很快,本文提到的版本(v2.0.0)、規格與各平台價格請以官方為準。
Pocket TTS 到底是什麼?
它是法國 AI 實驗室 Kyutai Labs 開源的文字轉語音(TTS,Text-to-Speech)模型,用 MIT 授權,程式碼、模型權重全部公開,商用也免費。跟你熟悉的雲端服務(ElevenLabs、OpenAI TTS)最大的差別在於:它不上雲、不連網、不按字收費,整包連模型只有大約 300MB,跑在你自己的 CPU 上,資料一個位元組都不會離開你的電腦。
規格聽起來會讓人懷疑是不是打錯字:模型只有 1 億參數(100M),執行時只用到 2 個 CPU 核心,第一段聲音大約 200 毫秒就吐出來,整體生成速度是即時語速的 6 倍(在 MacBook Air M4 的 CPU 上實測)。它還能串流輸出、處理無限長的文字、支援英、法、德、葡、義、西 6 種語言,並且能在瀏覽器裡用 WebAssembly 直接跑。作者群是 Kyutai 的 Manu Orsini、Simon Rouard、Gabriel De Marmiesse 等人,跟做出 Moshi 的是同一批人。
| 比一比 | Pocket TTS(本地) | 雲端 TTS(ElevenLabs / OpenAI) | 傳統本地大模型 TTS |
|---|---|---|---|
| 硬體門檻 | 普通 CPU,免 GPU | 不用,算力在對方 | 通常要 GPU、幾 GB 顯存 |
| 費用 | 免費(開源) | 按字數 / 訂閱計費 | 免費,但吃電吃硬體 |
| 資料隱私 | 100% 留在本機 | 文字送上雲端 | 留在本機 |
| 首段延遲 | 約 200ms | 看網速,常 1 秒以上 | 常要等整句算完 |
| 複製聲音 | 5 秒錄音、零訓練 | 要上傳樣本 / 付費方案 | 多半要幾分鐘樣本 + 微調 |
| 檔案大小 | 約 300MB | 不用下載 | 常 2GB 以上 |
為什麼它能塞進 CPU 還跑得這麼快?
關鍵在架構換了想法。多數 AI 語音模型走「離散 token」路線:把聲音切成一小塊一小塊,讓模型一顆一顆去猜,運算很重,銜接也容易有機械感。Pocket TTS 改用 Kyutai 自己的 CALM(Continuous Audio Language Model,連續音訊語言模型),把聲音當成一條連續流動的波,用一步到位的一致性模型直接預測「聲音怎麼流」,省掉最耗算力的那一段。
打個比方:傳統雲端 TTS 像叫一台水罐車。你只想喝一口水,卻要等一台大卡車從倉庫(雲端)開到你家。Pocket TTS 比較像水龍頭——它已經裝在你家的水管(你的 CPU)裡,把手一扭水就流出來,而且不是等一整桶裝滿才給你,而是一段一段連續送,你可以馬上開始聽。有趣的是,Kyutai 試過把它放到 GPU 上跑,發現幾乎沒有變快,因為模型實在太小、批次又只有 1,CPU 已經夠用。這也是它敢叫「Pocket」的底氣。
5 秒複製一個人的聲音,是真的嗎?
是真的,而且不用「訓練」。傳統聲音複製要幾小時錄音、再花幾天微調模型;Pocket TTS 只要一段大約 5 到 10 秒的 .wav 檔,就能抽出一組「聲音指紋」(voice embedding)——音色、口音、甚至房間的殘響都會被記下來,再套到你要它唸的文字上。內建也附了 20 幾把預設聲線(alba、anna、charles 之類),想直接用不用自己錄。
有兩個現實要先講清楚。第一,它連樣本裡的雜訊都會一起複製,所以拿去複製的那段錄音一定要乾淨,背景有冷氣聲、回音,出來的語音就會帶著同樣的底噪。第二,也是更重要的一點:Kyutai 在授權裡明文禁止未經當事人同意複製他人聲音、以及任何拿來詐騙或假冒的用途。技術門檻歸零之後,守規矩就變成你自己的責任。用自己的聲音、或有授權的聲音,別去碰別人的。
不會寫程式,怎麼在自己電腦上跑?
最快的方式其實是零安裝:打開 kyutai.org/pocket-tts,直接在瀏覽器輸入文字、選聲線、生成、下載,先玩過再決定要不要裝。想在本機跑,也只有三步,零基礎也能照做(只要電腦有 Python 3.10 以上):
- 裝好套件管理器 uv(官方推薦,會自動處理相依套件,不用自己搞環境)。
- 生成一段語音:在終端機打
uvx pocket-tts generate --text "哈囉,這是我的第一段語音" --voice alba,它會在資料夾裡吐出一個 wav 檔,還順便印出速度統計。 - 開一個本地小網頁來玩:打
uvx pocket-tts serve,然後瀏覽器開http://localhost:8000,就有一個可以換聲線、貼文字、上傳自己錄音來複製聲音的介面,因為模型一直在記憶體裡,比命令列還快。
如果你是開發者、想把它接進自己的程式,Python API 也很精簡:load_model() 載入模型、get_state_for_audio_prompt() 選聲線或餵一段錄音、generate_audio() 生成,三行就出聲。載入模型跟處理聲音樣本這兩步比較慢,官方建議把模型留在記憶體、把常用聲線先用 export-voice 轉成 safetensors 檔,之後載入就是一瞬間的事。
Pocket TTS 跟雲端 TTS 差在哪?該選哪個?
差在你把「品質天花板」和「掌控權」哪個看得比較重。純論音質的細膩度和情緒表現,ElevenLabs 這類雲端頂規還是領先,畢竟人家跑的是大模型。但只要你的需求是「量大、要壓成本、資料不想外流、想離線隨時用」,Pocket TTS 的性價比幾乎沒有對手——它免費、在本機、按下去就有,而且量再大也不會多收你一毛錢。
下面這個小工具幫你把帳算清楚。填你每個月大概要生成多少字的語音、再填一個你參考的雲端單價,它會算出一年下來雲端要付多少、而 Pocket TTS 的軟體成本是零:
🧮 雲端 TTS vs Pocket TTS 一年成本試算
試算僅供參考,雲端價格各平台與方案不同,請以官網為準(截至 2026 年 7 月)。Pocket TTS 為開源軟體,成本為 $0,另需自備電腦硬體與電力。
它有什麼限制?哪些人先別急著換?
它不是萬能,官方自己也很老實地列了短板。目前你沒辦法在文字裡手動插入停頓或靜音來控制節奏;還沒支援 int8 量化,所以沒法再進一步壓運算;載入模型、匯出聲線這幾個「準備動作」偏慢,所以你得把模型留在記憶體裡才維持得住速度。語言方面現在是 6 種,中文還沒進官方支援,要做中文旁白目前得另尋方案。如果你追求的是廣告等級、帶細膩情緒起伏的商用配音,雲端頂規仍然更穩。但只要是「大量、日常、內部、要離線」的語音需求,這些限制多半你根本不會踩到。
內容創作者可以拿它做什麼、甚至賺什麼?
這才是對做自媒體、想多一條出路的人最實際的部分。一個免費、離線、能複製聲音又快的 TTS,等於把過去要花錢外包的語音工序整條搬回你桌面。幾個馬上能落地的方向:
- 影片旁白量產:短影音、知識型頻道的口白不用再一條條配音或付月費,腳本貼進去就出聲,改稿重生也免費。
- 有聲書 / Podcast 草稿:把文章、電子書轉成語音,社群上已經有人拿它接成「有聲書工具」,一鍵把長文變音檔。
- 本地語音助理:它能接 Home Assistant(透過 Wyoming 協定)、Discord 機器人、甚至有人做成 OpenAI 相容的串流伺服器,讓你的 AI agent 開口說話,全程不上雲。這一塊可以延伸讀我們寫過的 Dify 建 AI 應用教學,把語音接到你自己的 agent。
- 接案服務化:已經有人把它包成「20 秒複製聲音 + OpenAI 相容 API」的伺服器。你可以用同一套邏輯,替中小商家做客製語音(在取得授權的前提下),把免費工具變成一項收費服務。
邏輯跟我們一直講的一樣:工具本身免費不稀奇,稀奇的是你把「省下來的成本」翻成「一條能收錢的服務」。想走本地、省錢、保護資料這條路,可以順著讀我們實測過的 Ollama 本地跑 LLM 和 Meetily 100% 本地 AI 會議記錄,跟 Pocket TTS 是同一套「把 AI 搬回自己機器」的思路。
如果 Pocket TTS 不適合我,有什麼替代方案?
看你缺的是哪一塊。要中文、要頂級情緒配音,就往雲端的 ElevenLabs、OpenAI TTS 走,音質換金錢與隱私。想留在本地又要更多語言,可以看 Kokoro TTS(輕量、開源,但沒有 5 秒零樣本複製這種強項);要更強的聲音複製、不介意吃 GPU,就試 XTTS / Coqui 這類較重的方案。想要 Kyutai 同一家更高品質的版本,他們也有需要 GPU 的完整版 TTS。同樣做「把大模型搬回本地」的思路,也可以參考我們寫的 阿里 zvec 塞進 App 的向量資料庫,和 讓 Claude 看影片的開源指令。
新手行動清單(照做就上手)
- ✅ 先開
kyutai.org/pocket-tts網頁版,不用安裝,貼段文字試聽音質。 - ✅ 覺得可以,電腦裝好 uv,跑
uvx pocket-tts serve開本地介面。 - ✅ 用一段 5 秒、乾淨的自己錄音,試試看聲音複製效果。
- ✅ 把常用聲線用
export-voice存起來,之後載入秒開。 - ✅ 想接產品,用 Python API 三行接進你的 app 或語音助理。
- ✅ 動手前先確認:只複製自己或有授權的聲音,別碰別人的。
常見問題 FAQ
Pocket TTS 真的完全免費嗎?
軟體本身用 MIT 授權,完全開源、商用免費,沒有按字收費。你唯一的成本是自己的電腦硬體與電力,跑一次不會再向任何雲端付錢。
沒有 GPU、只有一台普通筆電也能跑嗎?
可以,這正是它的賣點。模型只有 100M 參數、只用 2 個 CPU 核心,官方測過放 GPU 也不會更快。只要有 Python 3.10 以上與 PyTorch 2.5+,一般筆電就跑得動。
Pocket TTS 支援中文嗎?
截至 2026 年 7 月,官方支援英、法、德、葡、義、西 6 種語言,中文還沒進官方名單。要做中文語音,目前得先用雲端服務或其他支援中文的開源方案。
用它複製別人的聲音合法嗎?
Kyutai 授權明文禁止未經同意複製他人聲音,以及任何詐騙、假冒用途。請只用自己的聲音或已取得授權的聲音,這是你使用時的法律責任。
免責聲明:本文為技術資訊整理與個人使用心得,非投資或商業建議。文中工具規格、版本與價格截至 2026 年 7 月,實際以官方為準。使用任何語音複製技術請遵守當地法律與平台授權條款,切勿未經同意複製他人聲音。本站不因讀者依本文操作所生之任何結果負責。
延伸閱讀:站內相關文章
- 微軟悄悄開源整套語音 AI:VibeVoice 把 60 分鐘 Podcast 變逐字稿,還能合成 4 人 90 分鐘對談
- VoxCPM2 是什麼?2026 免費開源 AI 配音實測:一句話造新聲音,還需要付費 ElevenLabs 嗎?
- Hallmark 是什麼?讓 AI 設計「不像 AI 做」的 skill:57 道防醜測試治好 AI 味(2026 實測)






發表迴響