MAI-Transcribe-2-Streaming 公开预览版:在语音结束前实现转写的机制

Microsoft 365・Azureカテゴリを表すパンダのイラスト Microsoft 365・Azure

关于本文
本文采用生成式人工智能辅助的自动生成流程制作。基于微软人工智能与微软学习中心 2026 年 10 月 1 日的官方信息,梳理 MAI-Transcribe-2-Streaming 的提供状态及实施时的核对要点。未执行 API。

验证状态:📘 已确认微软官方第一手信息,未执行 API
信息确认日期:2026 年 10 月 2 日。

微软人工智能发布了 MAI-Transcribe-2-Streaming。该模型无需等待说话者结束发言,即可返回临时的部分转写(partial transcript),并不断更新为最终结果。

新功能有哪些

微软介绍,该模型支持 60 种语言,并在接收到语音后 100 毫秒多一点的时间内返回首个部分转写。微软学习中心展示了一种架构:通过 WebSocket 持续发送音频流,并接收 intermediate(中间)、delta(增量)和 completed(完成)事件。

不过目前处于公开预览版

微软学习中心明确指出,目前处于公开预览版,不提供服务等级协议(SLA),且不建议用于生产工作负载。单个会话最长为 1 小时。使用该服务需要微软 Foundry 资源和模型部署。

关于可用区域,瑞典中部(Sweden Central)、美国中部(Central US)和印度南部(South India)显示为可用,美国东部 2 区(East US 2)则显示即将推出。即使服务支持全局访问,也需要确认处理区域。

管理员和开发人员当前需要确认的事项

  • 切勿直接将预览版投入业务生产环境

  • 音频数据的存储与传输方针

  • Entra 承载令牌(bearer token)或 API 密钥的管理

  • 在应用端避免混淆部分结果(partial)与最终结果(final)

  • 区域、配额与会话上限

  • 不仅要评估延迟,还要用实际数据评估错误识别率

价格

微软人工智能宣布,在 2026 年底之前,作为推出优惠价,每小时语音收费 0.54 美元。未来价格需要另行确认。

官方信息与第一手资料

文档信息

文章??
MAI-Transcribe-2-Streaming 公开预览版:在语音结束前实现转写的机制
?布日期
更新日期
来源
https://papanda925.com/?p=17701&lang=zh

?可: ?于本站?有相??利的正文及原??表,除非?有?明,可依据 CC BY 4.0 使用。本文可能包含使用生成式AI?建或??的内容。若代??有?可声明,或?接的GitHub???定了?可,?代?以??可?准。引用内容、第三方?料、?片及商?不在本?可范?内。 使用政策

标题和URL已复制