关于本文
本文采用生成式人工智能辅助的自动生成流程制作。基于微软人工智能与微软学习中心 2026 年 10 月 1 日的官方信息,梳理 MAI-Transcribe-2-Streaming 的提供状态及实施时的核对要点。未执行 API。验证状态:📘 已确认微软官方第一手信息,未执行 API
信息确认日期:2026 年 10 月 2 日。
微软人工智能发布了 MAI-Transcribe-2-Streaming。该模型无需等待说话者结束发言,即可返回临时的部分转写(partial transcript),并不断更新为最终结果。
新功能有哪些
微软介绍,该模型支持 60 种语言,并在接收到语音后 100 毫秒多一点的时间内返回首个部分转写。微软学习中心展示了一种架构:通过 WebSocket 持续发送音频流,并接收 intermediate(中间)、delta(增量)和 completed(完成)事件。
不过目前处于公开预览版
微软学习中心明确指出,目前处于公开预览版,不提供服务等级协议(SLA),且不建议用于生产工作负载。单个会话最长为 1 小时。使用该服务需要微软 Foundry 资源和模型部署。
关于可用区域,瑞典中部(Sweden Central)、美国中部(Central US)和印度南部(South India)显示为可用,美国东部 2 区(East US 2)则显示即将推出。即使服务支持全局访问,也需要确认处理区域。
管理员和开发人员当前需要确认的事项
切勿直接将预览版投入业务生产环境
音频数据的存储与传输方针
Entra 承载令牌(bearer token)或 API 密钥的管理
在应用端避免混淆部分结果(partial)与最终结果(final)
区域、配额与会话上限
不仅要评估延迟,还要用实际数据评估错误识别率
价格
微软人工智能宣布,在 2026 年底之前,作为推出优惠价,每小时语音收费 0.54 美元。未来价格需要另行确认。

