跳至主要內容
科技 新聞

一小時錄音 0.10 美元:微軟 MAI-Transcribe-2 上線,60 語種詞錯誤率壓到 5.2%

微軟 9 月 3 日發布 MAI-Transcribe-2,60 語種平均詞錯誤率 5.2%、限時每小時錄音收 0.10 美元,本文整理效能對比、新增功能與後續觀察訊號。

Techroomage 編輯部 閱讀約 9 分鐘
一小時錄音 0.10 美元:微軟 MAI-Transcribe-2 上線,60 語種詞錯誤率壓到 5.2%

微軟以「最快、最準確、最便宜」定位這個新轉錄模型,限時價掛到 2026 年底,說話者分離與逐詞時間戳同步補上生產環境的缺件。

0.10 美元與 5.2%,前者是微軟新轉錄模型 MAI-Transcribe-2 處理一小時錄音的限時價格,後者是它在 60 種支援語言上測得的平均詞錯誤率。9 月 3 日,微軟透過官方部落格宣布模型上線,開發者即日起可在 Microsoft Foundry、MAI Playground 與 OpenRouter 三個通路呼叫或試用。

微軟給它的定位是旗下「最快、最準確、最便宜的 AI 語音轉文字模型」。這個宣稱落在 Google、OpenAI、Anthropic 同時加碼轉錄能力的時間點上:當一小時錄音的處理費用被壓到一杯咖啡的零頭,最先被重新計價的,會是逐字稿、字幕與會議紀錄這些以聽打工時計酬的工作。

微軟官方部落格對 MAI-Transcribe-2 提出三項定位宣稱:最快、最準確與最便宜的語音轉文字模型

5.2% 的兩種測法

5.2% 來自 FLEURS 測試集,這是目前多語言語音辨識最常被引用的公開基準,涵蓋逾百種語言,各家模型的成績單幾乎都從這裡出發。微軟公布的細節裡有個值得注意的點:MAI-Transcribe-2 在「強制指定語言」與「自動推斷語言」兩種模式下,詞錯誤率完全相同,都是 5.2%。多數模型在自動推斷時會因為判錯語言而付出代價,兩個數字貼得越近,代表混語場景越不容易出錯。

對照組拉開了差距。同一測試中,Google Gemini 3.1 Pro 的兩項結果是 5.3% 與 5.8%,自動推斷時退步了半個百分點;OpenAI 的 GPT-Transcribe 是 10.4% 與 10.6%;長年作為開源基準的 Whisper v3-Large 則落在 22.8% 與 23.5%。換算下來,新一代商用模型與 Whisper 之間的差距已超過四倍,而 MAI-Transcribe-2 與 Gemini 3.1 Pro 之間,只剩小數點後一位的距離。

四款轉錄模型在 FLEURS 測試集的詞錯誤率比較,MAI-Transcribe-2 兩種模式皆為 5.2%,Gemini 3.1 Pro 為 5.3% 與 5.8%,GPT-Transcribe 為 10.4% 與 10.6%,Whisper v3-Large 為 22.8% 與 23.5%
數字越低越準

詞錯誤率的概念是「每一百個詞平均錯幾個」,把轉錄結果與人工校對的標準答案逐詞比對後算出。5.2% 意味著每一百個詞大約錯五個,落在可讀但仍需校對的區間。不過它是乾淨測試音檔上的平均值,遠場收音、重口音、多人同時說話的實際環境通常會讓數字變差,這也是同名模型的實際體感常常不如發布簡報的原因。

快十倍的速度,與掛到年底的限時價

速度成績出自第三方。微軟援引評測平臺 Artificial Analysis 的數據,稱 MAI-Transcribe-2 的處理速度比 GPT-Transcribe 快 10 倍、比 Anthropic 的 Scribe v2 快 7 倍、比 Google 的 Gemini 3.5 Transcribe 快 5 倍。有兩個細節值得留意:準確率比較表裡的 Gemini 是 3.1 Pro,速度比較表裡換成了 3.5 Transcribe,對照版本並不一致;此外,比較對象的組合由微軟挑選,完整而獨立的橫評還沒有出現。

定價採限時策略。上市期間每小時錄音收 0.10 美元,折合新臺幣約 3 元,優惠持續到 2026 年底,之後的價格尚未公布。轉錄一小時中文會議錄音的成本不到一枚十元硬幣,這個價位已經不是在跟人工聽打競爭,而是在跟其他模型的 API 報價單競爭。

MAI-Transcribe-2 的限時定價為每小時錄音 0.10 美元,優惠期間持續至 2026 年底
折合新臺幣約 3 元

說話者分離與逐詞時間戳,補上缺件

功能面補的是生產環境最常缺的兩塊。說話者分離能在同一段錄音裡區分不同發言者,把文字歸屬到對應的人,這是會議紀錄與訪談整理的基本需求,也是通用模型長年的弱項。逐詞時間戳記則為每個詞標上精確時間位置,字幕對齊、音訊檢索、剪輯導航都仰賴它,缺了這個,轉出來的文字只是一條無法定位的長字串。

轉寫風格分成兩種,對應兩種真實需求。verbatim 模式保留語氣詞與口誤,原文照錄,面向合規與分析場景,法庭與醫療紀錄要的是「他確實這樣說」;clean 模式刪除語氣詞,輸出適合直接閱讀的字幕與筆記,內容製作要的是「讀起來通順」。其他能力包括關鍵詞偏置(把特定人名與術語的辨識權重調高)、噪音環境轉寫,以及 60 種語言之間的自然混用:一段中英夾雜的對話不需要預先指定語言,模型會自動偵測並切換。對中文使用者來說,中英混雜的會議恰好是最常見、也最考驗轉錄工具的場景。

轉錄市場的座位表

把時間軸拉長,這場發布的位置更清楚。OpenAI 在 2022 年開源的 Whisper 把語音辨識門檻大幅拉低,新創拿它做起一整個世代的轉錄服務,免費開源方案至今仍是多數個人與小團隊的起點;但 v3-Large 的成績與新一代商用模型之間已出現四倍以上的差距,付費市場的空間就此打開。OpenAI 後來推出閉源的 GPT-Transcribe,Google 把轉錄能力放進 Gemini 家族、沿用旗艦與輕量分級的打法,與先前分析中Flash 級模型扛起日常呼叫量的分工一致;Anthropic 則有 Scribe 系列。微軟如今以 MAI-Transcribe-2 入座,並選擇把模型放上 OpenRouter 這類開放聚合通路,讓開發者按量計價直接呼叫,不必先綁進 Azure 生態。

MAI 這個名字也值得記住。它是微軟自研模型家族的統一命名,同時期還有支援中文等 16 種語言的全雙工語音模型 MAI Realtime 在測試中。轉錄與對話語音分屬兩條產品線,卻指向同一個方向:微軟的語音能力正從服務組合包,走向以單一模型掛牌上架、名稱收攏在 MAI 底下的新形態。

誰先被影響,接下來看什麼

開發者是第一層受眾。做會議工具、Podcast 後製、客服質檢與媒體字幕的團隊,轉錄長期是他們最大的變動成本之一,限時價等於給了一段低成本試錯期。內容工作者是第二層:上字幕的創作者、整理訪談的記者、轉課堂錄音的學生,過去在免費工具與大量手工修正之間取捨的人,多了一個負擔得起的選項。

人工聽打服務站在更隱性的一側。當商用模型的詞錯誤率普遍進到 5% 上下,人工的價值會從「聽打」移向「核對與標記」,這個轉移在機器翻譯身上已經完整演過一輪,轉錄正在補完同樣的劇本。

接下來有幾件事可以驗證。限時價到期後的正式定價,以及 Google 與 OpenAI 是否跟進調整 API 價格;說話者分離在三個人以上、頻繁搶話的會議裡的實際準確度;FLEURS 之外,第三方在真實錄音上的獨立橫評何時出現。對需要處理大量錄音的人,眼下最有用的驗收動作很簡單:拿一小時自己的真實錄音去試。中英混雜、多人交談、環境噪音這幾個條件,比任何基準測試的成績單誠實,而試一次的成本是 0.10 美元。

#微軟#語音轉錄#ai模型