Microsoft AI 发布 MAI-Transcribe-2-Streaming,用于边接收音频边输出转录文字。模型覆盖 60 种语言,支持自动、连续的语言识别。与等用户说完后再返回完整文本的方式不同,它会先给出临时结果,随着后续语音进入再修正,最后提交稳定文本。
配套发布的 MAI-Voice-2.1 支持 23 种语言、26 个地区设置,允许同一个声音在不同语言间切换。Flash 版本面向调用量较大、对等待时间更敏感的应用。两个版本均支持从短参考音频建立声音,并附带同意使用方面的控制。
官方列出的价格是:流式转录每小时音频 0.54 美元,为年末前的首发价;Voice-2.1 每百万字符 22 美元,Flash 为 15 美元。微软展示的速度和排行榜成绩来自其公布的测试口径。对于实时字幕、听写和语音助手,这次更新提供了可组合的语音输入与输出组件。