Microsoft、音声認識「MAI-Transcribe-2」を公開 - 音声1時間$0.10、年内限りの価格
Microsoft AIが2026年9月3日、音声認識モデルMAI-Transcribe-2を公開した。FLEURSの60言語平均WERは5.2%で同社の比較表では首位、価格は音声1時間あたり$0.10。ただしこの価格は年内限定で、同じページに載るArtificial Analysisの2つの指標ではいずれも2位である。
Microsoft AIが2026年9月3日、音声認識モデル MAI-Transcribe-2 を公開した1。同社はこれを「自社でこれまでで最も高性能な書き起こしモデルであるだけでなく、競合の中でも最も高性能かつ効率的」と位置づけている1。
数字で目を引くのは価格で、音声1時間あたり$0.101。ただしこれは恒久的な改定ではなく、記事本文には「提供開始時点では、年内までの期間限定価格として1時間$0.10」と書かれている1。
60言語平均5.2%、日本語は1.8%
同社が挙げているのは3つの成果だ。FLEURSベンチマークの60言語平均で単語誤り率(WER)5.2%で首位、Artificial Analysisにおける精度とレイテンシのパレートフロンティアを定義していること、そしてArtificial AnalysisのWERリーダーボードでは 2位 であること1。
FLEURSの比較表は、言語を指定した場合(forced language)と、モデルに言語を推定させた場合(inferred language)の2通りで載っている1。
| モデル | 言語を指定 | 言語を推定させる |
|---|---|---|
| MAI-Transcribe-2 | 5.2% | 5.2% |
| Gemini 3.1 Pro | 5.3% | 5.8% |
| Gemini 3.5 Transcribe | 5.9% | 8.6% |
| Scribe v2 | 6.2% | 6.5% |
| Gemini 3.6 Flash | 6.9% | 9.4% |
| GPT-transcribe | 10.4% | 10.6% |
| Whisper v3-large | 22.8% | 23.5% |
差がはっきり出るのは右の列である。MAI-Transcribe-2は言語を指定してもさせなくても5.2%で変わらないのに対し、8月26日に公開プレビューが始まったGemini 3.5 Transcribeは5.9%から8.6%へ、Gemini 3.6 Flashは6.9%から9.4%へ悪化する1。言語が事前に分からない音声を投げる用途では、この差が効く(なお注記として、Gemini 3.5 TranscribeのウルドゥーとGemini 3.6 Flashのブルガリア語・スワヒリ語の一部はGemini 3.1 Proの数値が使われている)1。
言語別の内訳も公開されており、こちらは言語を指定した条件での比較である1。日本語は1.8% で、掲載されている7モデルの中で最小だった1。中国語は4.5%で最小、イタリア語は1.1%でGemini 3.5 Transcribeと並んで最小だった1。
一方で、すべての言語で勝っているわけではない。英語は2.7% で、Gemini 3.1 ProとScribe v2の2.6%に及ばない1。ウルドゥー語は13.3%で、Gemini 3.1 Proの12.1%が上だ1。ヘブライ語は13.7%で最小ではあるが、7モデルすべてが二桁である1。用途の言語が英語中心なのか、それ以外を含むのかで、比較の結論は変わる。
見出しの3つの最上級と、同じページのグラフ
記事のタイトルで同社は「世界で最も速く、最も正確で、最も安い音声認識モデル」と書いている1。ただし、同じページに載っているグラフはそこまでは言っていない。
同社が掲載している Artificial AnalysisのWER指数(AA-WER) のグラフでは、MAI-Transcribe-2は 2.0%で2位 である1。1位はAlibabaのFun-Realtime-ASR-previewで1.7%1。以下、ElevenLabsのScribe v2が2.2%、同社の前世代 MAI-Transcribe-1.5 が2.4%、Gemini 3.5 Transcribeが2.6%、OpenAIのGPT Transcribeが3.3%、Whisper Large v3が4.1%と続く1。この指数はAA-AgentTalk(50%)、VoxPopuli-Cleaned-AA(25%)、Earnings22-Cleaned-AA(25%)の3つのデータセットで構成されると注記されている1。本文自身が「2位」と書いているとおりである1。
速度係数(1秒あたりに書き起こせる入力音声の秒数) のグラフでも、首位はDeepgramのNova-3で501.4、MAI-Transcribe-2は 403.6で2位 だ1。以下の数値はいずれも同社のページに載っている図の値であり、Artificial Analysisのリーダーボードは随時更新されるため、現在の表示値とは異なりうる。以下、Reson8のResonant-1が331.2、Whisper Large v3(together.ai経由)が287.9、SpaceXAIのGrok Speech to Textが225、Gemini 3.5 Transcribeが79.6、Scribe v2が54.7、GPT Transcribeが40.8となっている1。同社は「速度係数400なら、1時間の音声の書き起こしがおよそ9秒で返る」と説明している1。
同社が本文で挙げている倍率は、Artificial Analysisが実施した評価に基づくとして「GPT-Transcribeの10倍、Scribe v2の7倍、Gemini 3.5 Transcribeの5倍の速さで、なおかつ精度は上」というものだ1。上の速度係数の数値と突き合わせると、それぞれ約9.9倍、約7.4倍、約5.1倍で整合する。
つまり、同ページの資料が示しているのは「FLEURSの60言語平均で首位」であることと、精度と速度をそれぞれ2位で両立していることである。同社は散布図について、MAI-Transcribe-2が最も望ましい象限に単独で位置すると説明しているが1、個別の指標で世界一だと示されているわけではない。8月にHume AIの研究者らが公開した検査が示したように、音声認識のベンチマークは参照書き起こしの誤りごと再現してしまう例もある。ベンダー自身が並べた数字は、どの指標のどの条件かまで見て読む必要がある。
何ができるモデルなのか
機能面では、書き起こしそのものより周辺の作り込みが並ぶ1。
- 話者ダイアライゼーション — 録音の中で話者を区別し、単語を正しい人物に割り当てる
- 単語単位のタイムスタンプ — 全単語に正確な時刻を付け、位置合わせ・検索・編集を容易にする
- キーワードバイアス — 分野固有の専門用語、略語、名前など、文脈だけでは判別しにくい語を認識させる
- 出力スタイルの切り替え — 「verbatim」はフィラーや言い直しを含めて話されたままを取り、「clean」はフィラーを除いて読みやすい字幕やメモにする
- コードスイッチング — HinglishやSpanglishのように会話中で言語が混ざる場合に対応
- 自動言語識別 — 事前に言語を指定しなくても、話されている言語を判別する
同社は用途として、診療記録、法務文書、アクセシビリティ、クローズドキャプションを挙げている1。verbatim と clean の使い分けは、この並びを見ると分かりやすい。コンプライアンスや分析の用途では言い直しまで残す必要があるが、公開する字幕では邪魔になる、という切り分けである。
提供は Microsoft Foundry、MAI Playground、OpenRouter を通じて、公開当日から試せるとしている1。
単価が1桁変わると何が変わるか
音声を大量に処理する業務——会議の議事録、コールセンターの記録、動画の字幕付け——では、書き起こしの単価がそのまま処理量の上限になっていることが多い。1時間$0.10という水準は、これまで「全部は回せないので一部だけ」としていた運用の前提を変える余地がある。
ただし条件が2つ付く。1つは、この価格が 年内までの期間限定 だと明記されていること1。年をまたぐ予算や複数年の見積もりでこの単価を恒久的な前提に置くのは危うい。もう1つは、言語による精度差 である。60言語平均の5.2%という数字は、日本語1.8%からヘブライ語13.7%までの幅を均したものだ1。扱う言語が偏っている場合は、平均値ではなく言語別の数字を見るほうが実態に近い。
MicrosoftはMAIシリーズを、コーディング向けのMAI-Code-1.1-Flashやセキュリティ特化のMAI-Cyber-1-Flashなど、用途を絞ったモデルを揃える形で広げてきた。今回の音声認識も、汎用の大規模モデルで音声を扱うのではなく、専用モデルを安く速く出す路線に沿っている。評価の側でも、Open ASR Leaderboardにヒンディー語とインド英語の評価セットが加わったように、言語ごとの実力を測る材料は増えつつある。ベンダーの提示する平均値と、自社の音声で測った結果を突き合わせられる環境は整ってきている。
Sources
- MAI-Transcribe-2 is the fastest, most accurate and cheapest speech recognition model in the world - Microsoft AI公式ブログ(2026年9月3日)。本文・機能一覧および掲載チャート(FLEURS 60言語平均、AA-WER指数、速度係数、言語別WER)の数値
この記事は役に立ちましたか?
ありがとうございます!
受け取りました。ありがとうございます!