この記事について
この記事は、生成AIを活用した自動生成フローで作成しています。Microsoft AIとMicrosoft Learnの2026年10月1日公式情報を基に、MAI-Transcribe-2-Streamingの提供状況と実装時の確認点を整理します。API実行は行っていません。検証ステータス:📘 Microsoft公式一次情報確認済み・API実行未確認
情報確認日:2026年10月2日。
Microsoft AIはMAI-Transcribe-2-Streamingを公開しました。話者が話し終えるまで待たず、途中の仮説であるpartial transcriptを返しながら確定結果へ更新していくモデルです。
何が新しいか
Microsoftは60言語対応、最初のpartialを音声受信から100ms強で返すと説明しています。Microsoft LearnではWebSocketを使い、audioを連続streamとして送り、intermediate/delta/completedイベントを受け取る構成が示されています。
ただしPublic Preview
Microsoft Learnは現在Public Previewで、SLAなし・production workloadには推奨しないと明記しています。1 sessionは最大1時間です。利用にはMicrosoft Foundry resourceとmodel deploymentが必要です。
提供regionとしてSweden Central、Central US、South IndiaがAvailable、East US 2はComing soonと案内されています。サービスはglobal accessでも処理regionの確認は必要です。
管理者・開発者が今確認すること
Previewを業務本番へ直接入れない
音声データの保存・転送方針
Entra bearer tokenまたはAPI keyの管理
partialとfinalをアプリ側で混同しない
region、quota、session上限
latencyだけでなく誤認識率も実データで評価する
価格
Microsoft AIは2026年末までintroductory priceとして音声1時間0.54ドルと発表しています。将来の価格は別途確認が必要です。
