MAI-Transcribe-2-Streaming公開プレビュー ― 音声を話し終える前から文字化する仕組み

Microsoft 365・Azureカテゴリを表すパンダのイラスト Microsoft 365・Azure

この記事について
この記事は、生成AIを活用した自動生成フローで作成しています。Microsoft AIとMicrosoft Learnの2026年10月1日公式情報を基に、MAI-Transcribe-2-Streamingの提供状況と実装時の確認点を整理します。API実行は行っていません。

検証ステータス:📘 Microsoft公式一次情報確認済み・API実行未確認
情報確認日:2026年10月2日。

Microsoft AIはMAI-Transcribe-2-Streamingを公開しました。話者が話し終えるまで待たず、途中の仮説であるpartial transcriptを返しながら確定結果へ更新していくモデルです。

何が新しいか

Microsoftは60言語対応、最初のpartialを音声受信から100ms強で返すと説明しています。Microsoft LearnではWebSocketを使い、audioを連続streamとして送り、intermediate/delta/completedイベントを受け取る構成が示されています。

ただしPublic Preview

Microsoft Learnは現在Public Previewで、SLAなし・production workloadには推奨しないと明記しています。1 sessionは最大1時間です。利用にはMicrosoft Foundry resourceとmodel deploymentが必要です。

提供regionとしてSweden Central、Central US、South IndiaがAvailable、East US 2はComing soonと案内されています。サービスはglobal accessでも処理regionの確認は必要です。

管理者・開発者が今確認すること

  • Previewを業務本番へ直接入れない

  • 音声データの保存・転送方針

  • Entra bearer tokenまたはAPI keyの管理

  • partialとfinalをアプリ側で混同しない

  • region、quota、session上限

  • latencyだけでなく誤認識率も実データで評価する

価格

Microsoft AIは2026年末までintroductory priceとして音声1時間0.54ドルと発表しています。将来の価格は別途確認が必要です。

公式情報・一次情報

文書情報

記事タイトル
MAI-Transcribe-2-Streaming公開プレビュー ― 音声を話し終える前から文字化する仕組み
作成日
更新日
Source URL
https://papanda925.com/?p=17459

ライセンス: 本記事のうち、当サイトが権利を有する本文・自作図表は、特記なき限り CC BY 4.0 で利用できます。生成AIを活用して作成・編集した内容を含みます。コードについて、別途ライセンス表示またはリンク先GitHubリポジトリのライセンスがある場合は、その条件を優先します。引用・第三者資料・画像・商標等は本ライセンスの対象外です。 利用ポリシー

タイトルとURLをコピーしました