最後更新:2026 年 8 月 4 日
微軟做了一件事,然後什麼都沒說。沒有公告、沒有 model card、沒有定價頁——只在內部 Playground 冒出一個隱藏條目。
一句話結論:MAI Realtime 是微軟第一個「全雙工」語音模型,可以一邊聽一邊講、讓你中途插嘴,支援 17 種語言含中文。但它目前只是隱藏預覽,單一來源爆料,你現在還用不到。
這篇拆三件事:它為什麼值得注意、跟你現在能用的 OpenAI 方案差在哪、以及有哪 5 個問題微軟到現在還沒回答。文末有兩個互動工具,一個幫你算「等 AI 講完」一年浪費多少時間,一個幫你選現在就能用的替代方案。
MAI Realtime 是什麼?
它是微軟正在測試的原生即時語音模型,2026 年 8 月 2 日由科技媒體 TestingCatalog 獨家挖出,出現在微軟 MAI Playground 的一個隱藏 early-access 條目裡,目前只有一小群合作夥伴摸得到。
先講清楚定位,免得看完以為可以馬上下載來玩:微軟從頭到尾沒有發布過這個模型。公開的 MAI Playground 目錄現在只有 MAI-Image-2.5、MAI-Transcribe-1.5、MAI-Voice-2 三個,沒有 MAI Realtime。所有細節都來自 TestingCatalog 的單一來源報導,不是微軟的產品承諾。
「全雙工」到底是什麼意思?
用電話來理解最快。
你現在跟 ChatGPT 或 Copilot 語音對話,體感像用對講機:你講完,放開,等它講完,才輪到你。中間如果它答歪了,你只能坐著聽完那 40 秒,或者硬生生打斷再重來。這叫半雙工(half-duplex),一次只能一個方向通。
全雙工(full-duplex)是打電話。兩邊可以同時出聲,你講到一半發現對方會錯意,隨口「欸不是,我是說⋯⋯」就切進去了,對方停下來、記得剛才講到哪、接著回你。人跟人講話本來就長這樣。
技術上的差別在於,過去的語音助理是三段接力:語音辨識轉文字 → 模型生成文字 → 文字轉語音。每一棒都要等上一棒跑完。原生全雙工模型把音訊直接當成對話的一部分處理,聽、想、講可以疊在一起發生。
這件事難在哪?難在判斷「你講完了沒」。一個三秒的停頓,可能是「我講完了換你」,也可能是「我在想」。答錯的代價很直接:不是被 AI 搶話,就是你講完它還在發呆。做語音 agent 的人普遍同意,這是整條鏈裡最難調的一段。
目前挖到哪些具體細節?
截至 2026 年 8 月 4 日,公開資訊如下(全部來自 TestingCatalog 的實測,未經微軟證實):
| 項目 | 已知內容 |
|---|---|
| 語言 | 17 種:英、德、西、法、義、葡、日、韓、中文、荷、印地、印尼、阿拉伯、俄、土耳其、越南、泰 |
| 語音 | 2 把:Victoria、Grant,實測比 Copilot 現有語音模式自然 |
| 語言切換 | 可鎖定或自動偵測,對話中途換語言不會亂掉 |
| 斷句判斷 | 兩種可選:Switchboard 模式(MAI-Ears 端點偵測 + 內嵌控制 token)/確定性模式(靜音偵測 + Whisper 語意端點偵測) |
| 插話處理 | 乾淨,延遲低(未公布實測數字) |
| 不會做的事 | 不唱歌、不生成非語音音效——定位是對話系統,不是通用音訊生成器 |
| 開發者介面 | Debug 面板可看即時延遲、處理步驟、模型「思考」過程 |
兩種斷句模式的差別在實際使用中很細微。值得注意的是 Switchboard 這個名字和 MAI-Ears 這個元件,目前都沒有第三方獨立證實過。
微軟為什麼需要自己做這個?
因為它的語音家族缺一塊,而且缺得很明顯。
微軟目前的 MAI 語音模型全部是單向的:MAI-Transcribe-1.5 負責把聲音變文字(支援 43 種語言),MAI-Voice-2 和它的 Flash 版負責把文字變聲音(15 種語言,還能從一小段樣本模仿聲線)。兩頭都有了,中間那層「聲音直接進、聲音直接出」的模型是空的。
那塊空缺現在靠誰?靠 OpenAI。Azure 的 Voice Live API 支援的即時模型清單裡列著 GPT-Realtime、GPT-Realtime Mini、GPT-Realtime 1.5,而且文件明講 semantic_vad 模式只在 GPT-Realtime 和 Mini 上可用。
把時間拉長看,Mustafa Suleyman 帶的微軟 superintelligence 團隊在 2026 年 Build 一口氣端出七個自研模型,一路把 Copilot、Teams、Bing 裡的 OpenAI 元件換成自家的。語音的最後一塊拼圖補上,這條路線就完整了。微軟這一年在開源和自研兩邊都推得很兇,先前的 SkillOpt 和 VibeVoice 都是同一個節奏。
不過這裡有個常被略過的事實:Voice Live 的支援清單裡其實也有 azure-realtime 和 phi4-mm-realtime。微軟並非完全沒有非 OpenAI 的即時語音選項。MAI Realtime 會是取代 azure-realtime 的新品牌、還是一個給 Copilot 規模用的更高階模型,目前無解。
跟 OpenAI 的 GPT-Realtime 比,差在哪?
最大的差別是「一個能用、一個不能用」。以下對照截至 2026 年 8 月:
| 維度 | MAI Realtime | OpenAI GPT-Realtime 系列 |
|---|---|---|
| 全雙工 | 是(報導) | 是 |
| 公開發布 | 否,隱藏預覽 | 是,已 GA |
| Model card | 無 | 有 |
| 定價 | 未公布 | 已公布 |
| 可部署區域 | 未公布 | 已公布 |
| 語言數 | 17(報導) | 多語,含中文 |
| 企業合規文件 | 無 | 有 |
| 你今天能用嗎 | 不能 | 能,透過 Azure Foundry 或 OpenAI API |
換句話說,這則新聞的價值在於情報,不在於工具。它告訴你微軟接下來要往哪走,但今天要交付產品的人,還是得用現有的方案。
有哪 5 件事微軟還沒回答?
這段是這篇文章跟其他報導最不一樣的地方。中文圈接下來大概會有一批「微軟推出全雙工語音模型」的標題,但下面這五個問題沒有答案之前,任何人都不該把它寫進技術規劃書。(同一個道理,評測標準本身也在失效——demo 好看跟能上線是兩件事。)
- 它到底存不存在於產品線上?微軟公開的 Voice Live 模型表,截至 8 月 2 日沒有 MAI Realtime。沒有公開的開發者合約,就沒有可規劃性。
- 定價怎麼算?語音模型通常按音訊分鐘或 token 計費,差一個級距,客服機器人的單位成本就翻倍。
- 資料怎麼處理?語音 agent 天天在接收個資、帳號、健康狀況、財務對話。保留期限、地理處理範圍、日誌控制、內容安全行為,微軟一項都還沒公布,因為它根本還沒發布。
- 延遲數字是多少?報導說「延遲低、插話乾淨」,但沒有任何實測毫秒數。而且語音品質從來不只是模型的事——藍牙耳機、網路抖動、瀏覽器音訊管線都會影響體感。微軟自己就警告過,伺服器端的回音消除假設你會立刻播放回應音訊,播放延遲超過兩秒就會退化。
- Debug 面板顯示的「模型思考」可信嗎?介面能看到內部診斷軌跡,跟那是模型真實推理過程的可靠呈現,是兩件事。不建議繞著它建工作流程。
等 AI 講完,一年浪費你多少時間?
全雙工聽起來像是體驗上的小改善,但它省下的是每一次對話的等待。自己算一下比較有感:
🧮 回合制等待時間試算機
估算「等 AI 把話講完」一年吃掉你多少時間。
這也解釋了為什麼微軟急著補這塊:對個人用戶,全雙工是體驗升級;對跑一整個客服中心的企業,它是直接的人力成本。
你現在能用什麼替代?
MAI Realtime 沒有時間表,所以與其等,不如看清楚手上有什麼。回答三題,看你這個用途現在該用哪個:
🎯 語音 AI 方案選擇器
1. 你要做什麼?
2. 資料能不能離開你的機器?
3. 預算?
幾個延伸閱讀可以直接接上去:OpenAI 把同聲傳譯打到 0.034 美元一分鐘、微軟開源的 VibeVoice 整套語音 AI、VoxCPM2 免費配音實測、Pocket TTS 用 CPU 複製聲音。
對一般人和想接案的人,這件事意味著什麼?
短期什麼都沒變。你今天打開 Copilot 講話,它還是會等你講完才回。
中期值得留意的是語音客服這個市場的門檻正在往下掉。過去要做一個能接電話、能被打斷、還能中途換語言的語音 agent,要嘛買整套昂貴的 contact center 方案,要嘛自己接四五個服務再花幾個月調參。當全雙工模型變成 API 的一個選項,這件事會變成一個人週末就能做出雛形的東西。
如果你在找 AI 相關的接案切入點,這裡有個現實的觀察:企業掏錢買的多半是「幫我把這套接到我的電話系統/預約系統/CRM」,模型本身反而是最容易替換的一環。模型會愈來愈便宜,串接和調校的價值卻更穩。想練這條線的話,先從 n8n 這類工作流自動化工具入手比較實際,語音只是其中一個節點。整體市場規模與採用率可參考這份 AI 統計數據整理。
還有一點提醒:語音 agent 的失敗從來不在 demo 裡。demo 用好耳機、安靜房間、標準口音,聽起來都很順。真正的考驗是藍牙延遲、環境噪音、講到一半改講英文的專有名詞、以及那個三秒的停頓到底算不算講完。看到任何廠商的語音 demo,先問一句:能不能在我的辦公室、用我的耳機、講我的口音試一次。
接下來該追蹤什麼?
- 微軟公開的 Voice Live 模型表:MAI Realtime 什麼時候出現在這裡,才是它真正變成產品的那一天。
- MAI Playground 公開目錄:現在只有三個模型,多出第四個就是訊號。
- Microsoft Foundry 的定價頁:定價出來,才知道它打的是消費級 Copilot 還是企業級 API。
- Copilot 語音模式的體感變化:如果哪天你發現可以中途插嘴,代表它已經悄悄換底了。
行動清單
- ☐ 今天要交付語音專案的,直接用 GPT-Realtime,別等 MAI Realtime
- ☐ 用上面的選擇器確認你的用途對應哪個現成方案
- ☐ 實作即時語音走 WebRTC,不要用一般 WebSocket
- ☐ 測試一定要用真實環境:你的耳機、你的網路、你的口音
- ☐ 看到「微軟推出全雙工語音模型」的標題,先確認它有沒有 model card
常見問題
MAI Realtime 現在可以用嗎?
不行。它目前是 MAI Playground 裡的隱藏 early-access 條目,只有一小群合作夥伴有權限。微軟沒有公開發布,也沒有給時間表。
MAI Realtime 支援中文嗎?
根據 TestingCatalog 的報導支援,中文是它 17 種語言的其中一種。但因為是單一來源,微軟未證實,中文的實際表現如何目前無從判斷。
全雙工跟現在的語音助理差在哪?
現在的語音助理是回合制,你講完它才講,中間打斷體驗很差。全雙工可以同時聽和講,你能像講電話一樣中途插嘴,它會停下來、接住上下文再回應。
它會取代 OpenAI 的 GPT-Realtime 嗎?
在微軟自家產品線裡有這個可能,因為 Azure 的即時語音層目前仍依賴 GPT-Realtime。但微軟的 Voice Live 也已經支援 azure-realtime 和 phi4-mm-realtime,所以 MAI Realtime 的定位還不明朗。
那我現在該用什麼做語音 agent?
OpenAI 的 GPT-Realtime 系列,可以透過 Azure Voice Live API 或 OpenAI 官方 API 使用。它有完整的 model card、定價和區域資訊,是目前唯一成熟的全雙工選項。
參考資料
- TestingCatalog,《Exclusive: Microsoft tests new MAI Realtime voice model》,2026-08-02(第一手爆料來源)
- WindowsForum News Desk,《Microsoft MAI Realtime Appears in Hidden Preview, No Launch Confirmed》,2026-08-02(交叉查證與限制分析)
- Microsoft Learn,Voice Live API 文件(支援模型清單、語音活動偵測、回音消除說明)
- Microsoft AI,《Building a hill-climbing machine: Launching seven new MAI models》
免責聲明:本文為科技資訊整理,非投資建議。文中關於 MAI Realtime 的細節主要來自 TestingCatalog 的單一來源報導,微軟至今未公開發布該模型、未提供 model card、定價或可用區域。所有規格與功能描述均為報導內容,並非微軟的產品承諾,實際情況以微軟官方公告為準。文中提及的工具價格與功能截至 2026 年 8 月,AI 產品更新頻繁,請以各官網最新資訊為準。





發佈留言