最後更新:2026 年 8 月 4 日

微軟做了一件事,然後什麼都沒說。沒有公告、沒有 model card、沒有定價頁——只在內部 Playground 冒出一個隱藏條目。

一句話結論:MAI Realtime 是微軟第一個「全雙工」語音模型,可以一邊聽一邊講、讓你中途插嘴,支援 17 種語言含中文。但它目前只是隱藏預覽,單一來源爆料,你現在還用不到。

這篇拆三件事:它為什麼值得注意、跟你現在能用的 OpenAI 方案差在哪、以及有哪 5 個問題微軟到現在還沒回答。文末有兩個互動工具,一個幫你算「等 AI 講完」一年浪費多少時間,一個幫你選現在就能用的替代方案。

MAI Realtime 是什麼?

它是微軟正在測試的原生即時語音模型,2026 年 8 月 2 日由科技媒體 TestingCatalog 獨家挖出,出現在微軟 MAI Playground 的一個隱藏 early-access 條目裡,目前只有一小群合作夥伴摸得到。

先講清楚定位,免得看完以為可以馬上下載來玩:微軟從頭到尾沒有發布過這個模型。公開的 MAI Playground 目錄現在只有 MAI-Image-2.5、MAI-Transcribe-1.5、MAI-Voice-2 三個,沒有 MAI Realtime。所有細節都來自 TestingCatalog 的單一來源報導,不是微軟的產品承諾。

「全雙工」到底是什麼意思?

用電話來理解最快。

你現在跟 ChatGPT 或 Copilot 語音對話,體感像用對講機:你講完,放開,等它講完,才輪到你。中間如果它答歪了,你只能坐著聽完那 40 秒,或者硬生生打斷再重來。這叫半雙工(half-duplex),一次只能一個方向通。

全雙工(full-duplex)是打電話。兩邊可以同時出聲,你講到一半發現對方會錯意,隨口「欸不是,我是說⋯⋯」就切進去了,對方停下來、記得剛才講到哪、接著回你。人跟人講話本來就長這樣。

技術上的差別在於,過去的語音助理是三段接力:語音辨識轉文字 → 模型生成文字 → 文字轉語音。每一棒都要等上一棒跑完。原生全雙工模型把音訊直接當成對話的一部分處理,聽、想、講可以疊在一起發生。

這件事難在哪?難在判斷「你講完了沒」。一個三秒的停頓,可能是「我講完了換你」,也可能是「我在想」。答錯的代價很直接:不是被 AI 搶話,就是你講完它還在發呆。做語音 agent 的人普遍同意,這是整條鏈裡最難調的一段。

目前挖到哪些具體細節?

截至 2026 年 8 月 4 日,公開資訊如下(全部來自 TestingCatalog 的實測,未經微軟證實):

項目已知內容
語言17 種:英、德、西、法、義、葡、日、韓、中文、荷、印地、印尼、阿拉伯、俄、土耳其、越南、泰
語音2 把:Victoria、Grant,實測比 Copilot 現有語音模式自然
語言切換可鎖定或自動偵測,對話中途換語言不會亂掉
斷句判斷兩種可選:Switchboard 模式(MAI-Ears 端點偵測 + 內嵌控制 token)/確定性模式(靜音偵測 + Whisper 語意端點偵測)
插話處理乾淨,延遲低(未公布實測數字)
不會做的事不唱歌、不生成非語音音效——定位是對話系統,不是通用音訊生成器
開發者介面Debug 面板可看即時延遲、處理步驟、模型「思考」過程

兩種斷句模式的差別在實際使用中很細微。值得注意的是 Switchboard 這個名字和 MAI-Ears 這個元件,目前都沒有第三方獨立證實過。

微軟為什麼需要自己做這個?

因為它的語音家族缺一塊,而且缺得很明顯。

微軟目前的 MAI 語音模型全部是單向的:MAI-Transcribe-1.5 負責把聲音變文字(支援 43 種語言),MAI-Voice-2 和它的 Flash 版負責把文字變聲音(15 種語言,還能從一小段樣本模仿聲線)。兩頭都有了,中間那層「聲音直接進、聲音直接出」的模型是空的。

那塊空缺現在靠誰?靠 OpenAI。Azure 的 Voice Live API 支援的即時模型清單裡列著 GPT-Realtime、GPT-Realtime Mini、GPT-Realtime 1.5,而且文件明講 semantic_vad 模式只在 GPT-Realtime 和 Mini 上可用。

把時間拉長看,Mustafa Suleyman 帶的微軟 superintelligence 團隊在 2026 年 Build 一口氣端出七個自研模型,一路把 Copilot、Teams、Bing 裡的 OpenAI 元件換成自家的。語音的最後一塊拼圖補上,這條路線就完整了。微軟這一年在開源和自研兩邊都推得很兇,先前的 SkillOpt 和 VibeVoice 都是同一個節奏。

不過這裡有個常被略過的事實:Voice Live 的支援清單裡其實也有 azure-realtime 和 phi4-mm-realtime。微軟並非完全沒有非 OpenAI 的即時語音選項。MAI Realtime 會是取代 azure-realtime 的新品牌、還是一個給 Copilot 規模用的更高階模型,目前無解。

跟 OpenAI 的 GPT-Realtime 比,差在哪?

最大的差別是「一個能用、一個不能用」。以下對照截至 2026 年 8 月:

維度MAI RealtimeOpenAI GPT-Realtime 系列
全雙工是(報導)是
公開發布否,隱藏預覽是,已 GA
Model card無有
定價未公布已公布
可部署區域未公布已公布
語言數17(報導)多語,含中文
企業合規文件無有
你今天能用嗎不能能,透過 Azure Foundry 或 OpenAI API

換句話說,這則新聞的價值在於情報,不在於工具。它告訴你微軟接下來要往哪走,但今天要交付產品的人,還是得用現有的方案。

有哪 5 件事微軟還沒回答?

這段是這篇文章跟其他報導最不一樣的地方。中文圈接下來大概會有一批「微軟推出全雙工語音模型」的標題,但下面這五個問題沒有答案之前,任何人都不該把它寫進技術規劃書。(同一個道理,評測標準本身也在失效——demo 好看跟能上線是兩件事。)

  1. 它到底存不存在於產品線上?微軟公開的 Voice Live 模型表,截至 8 月 2 日沒有 MAI Realtime。沒有公開的開發者合約,就沒有可規劃性。
  2. 定價怎麼算?語音模型通常按音訊分鐘或 token 計費,差一個級距,客服機器人的單位成本就翻倍。
  3. 資料怎麼處理?語音 agent 天天在接收個資、帳號、健康狀況、財務對話。保留期限、地理處理範圍、日誌控制、內容安全行為,微軟一項都還沒公布,因為它根本還沒發布。
  4. 延遲數字是多少?報導說「延遲低、插話乾淨」,但沒有任何實測毫秒數。而且語音品質從來不只是模型的事——藍牙耳機、網路抖動、瀏覽器音訊管線都會影響體感。微軟自己就警告過,伺服器端的回音消除假設你會立刻播放回應音訊,播放延遲超過兩秒就會退化。
  5. Debug 面板顯示的「模型思考」可信嗎?介面能看到內部診斷軌跡,跟那是模型真實推理過程的可靠呈現,是兩件事。不建議繞著它建工作流程。

等 AI 講完,一年浪費你多少時間?

全雙工聽起來像是體驗上的小改善,但它省下的是每一次對話的等待。自己算一下比較有感:

🧮 回合制等待時間試算機

估算「等 AI 把話講完」一年吃掉你多少時間。

現在一年花在等待:—
全雙工後一年花在等待:—
一年省下:—

這也解釋了為什麼微軟急著補這塊:對個人用戶,全雙工是體驗升級;對跑一整個客服中心的企業,它是直接的人力成本。

你現在能用什麼替代?

MAI Realtime 沒有時間表,所以與其等,不如看清楚手上有什麼。回答三題,看你這個用途現在該用哪個:

🎯 語音 AI 方案選擇器

1. 你要做什麼?

2. 資料能不能離開你的機器?

3. 預算?

幾個延伸閱讀可以直接接上去:OpenAI 把同聲傳譯打到 0.034 美元一分鐘、微軟開源的 VibeVoice 整套語音 AI、VoxCPM2 免費配音實測、Pocket TTS 用 CPU 複製聲音。

對一般人和想接案的人,這件事意味著什麼?

短期什麼都沒變。你今天打開 Copilot 講話,它還是會等你講完才回。

中期值得留意的是語音客服這個市場的門檻正在往下掉。過去要做一個能接電話、能被打斷、還能中途換語言的語音 agent,要嘛買整套昂貴的 contact center 方案,要嘛自己接四五個服務再花幾個月調參。當全雙工模型變成 API 的一個選項,這件事會變成一個人週末就能做出雛形的東西。

如果你在找 AI 相關的接案切入點,這裡有個現實的觀察:企業掏錢買的多半是「幫我把這套接到我的電話系統/預約系統/CRM」,模型本身反而是最容易替換的一環。模型會愈來愈便宜,串接和調校的價值卻更穩。想練這條線的話,先從 n8n 這類工作流自動化工具入手比較實際,語音只是其中一個節點。整體市場規模與採用率可參考這份 AI 統計數據整理。

還有一點提醒:語音 agent 的失敗從來不在 demo 裡。demo 用好耳機、安靜房間、標準口音,聽起來都很順。真正的考驗是藍牙延遲、環境噪音、講到一半改講英文的專有名詞、以及那個三秒的停頓到底算不算講完。看到任何廠商的語音 demo,先問一句:能不能在我的辦公室、用我的耳機、講我的口音試一次。

接下來該追蹤什麼?

  • 微軟公開的 Voice Live 模型表:MAI Realtime 什麼時候出現在這裡,才是它真正變成產品的那一天。
  • MAI Playground 公開目錄:現在只有三個模型,多出第四個就是訊號。
  • Microsoft Foundry 的定價頁:定價出來,才知道它打的是消費級 Copilot 還是企業級 API。
  • Copilot 語音模式的體感變化:如果哪天你發現可以中途插嘴,代表它已經悄悄換底了。

行動清單

  • ☐ 今天要交付語音專案的,直接用 GPT-Realtime,別等 MAI Realtime
  • ☐ 用上面的選擇器確認你的用途對應哪個現成方案
  • ☐ 實作即時語音走 WebRTC,不要用一般 WebSocket
  • ☐ 測試一定要用真實環境:你的耳機、你的網路、你的口音
  • ☐ 看到「微軟推出全雙工語音模型」的標題,先確認它有沒有 model card

常見問題

MAI Realtime 現在可以用嗎?

不行。它目前是 MAI Playground 裡的隱藏 early-access 條目,只有一小群合作夥伴有權限。微軟沒有公開發布,也沒有給時間表。

MAI Realtime 支援中文嗎?

根據 TestingCatalog 的報導支援,中文是它 17 種語言的其中一種。但因為是單一來源,微軟未證實,中文的實際表現如何目前無從判斷。

全雙工跟現在的語音助理差在哪?

現在的語音助理是回合制,你講完它才講,中間打斷體驗很差。全雙工可以同時聽和講,你能像講電話一樣中途插嘴,它會停下來、接住上下文再回應。

它會取代 OpenAI 的 GPT-Realtime 嗎?

在微軟自家產品線裡有這個可能,因為 Azure 的即時語音層目前仍依賴 GPT-Realtime。但微軟的 Voice Live 也已經支援 azure-realtime 和 phi4-mm-realtime,所以 MAI Realtime 的定位還不明朗。

那我現在該用什麼做語音 agent?

OpenAI 的 GPT-Realtime 系列,可以透過 Azure Voice Live API 或 OpenAI 官方 API 使用。它有完整的 model card、定價和區域資訊,是目前唯一成熟的全雙工選項。

參考資料

  • TestingCatalog,《Exclusive: Microsoft tests new MAI Realtime voice model》,2026-08-02(第一手爆料來源)
  • WindowsForum News Desk,《Microsoft MAI Realtime Appears in Hidden Preview, No Launch Confirmed》,2026-08-02(交叉查證與限制分析)
  • Microsoft Learn,Voice Live API 文件(支援模型清單、語音活動偵測、回音消除說明)
  • Microsoft AI,《Building a hill-climbing machine: Launching seven new MAI models》

免責聲明:本文為科技資訊整理,非投資建議。文中關於 MAI Realtime 的細節主要來自 TestingCatalog 的單一來源報導,微軟至今未公開發布該模型、未提供 model card、定價或可用區域。所有規格與功能描述均為報導內容,並非微軟的產品承諾,實際情況以微軟官方公告為準。文中提及的工具價格與功能截至 2026 年 8 月,AI 產品更新頻繁,請以各官網最新資訊為準。

加入 Mr. Slash 免費社群
第一時間收到交易所獨家優惠、AI 工具推薦、和市場分析更新
立即加入 Telegram 社群

關於Mr. Slash

「Mr. Slash 的系統性人生」,創立於 2024年,由 Mr. Slash 本人及專業編輯團隊經營的財經內容平台。

我們的宗旨是透過投資、財經、自動化與新興科技等領域的深入解說與應用,幫助讀者打造穩定的被動收入系統。內容涵蓋加密貨幣、股息資產、量化工具、平台分潤等實用策略,協助你用更聰明的方法配置資金、累積資產,走在財務自由的路上,少走冤枉路。

若為商業合作邀稿,將會清楚標註「不代表本站立場」。

商業合作

如果您有任何關於我們團隊或網站內容的疑問或建議,歡迎您前往IG 私訊 @slash.Capital聯繫我們,謝謝!

發佈留言

相關文章

最新文章

簡

探索更多來自 Mr. Slash 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀

Join Mr. Slash