Meta Superintelligence Labs 于 9 月 1 日推出首个实时音频感知模型 Muse Voice Transcribe:流式 ASR、20+ 说话人 diarization、endpointing,原生支持句内/句间语码转换,训练覆盖 70+ 语言(首发验证 25 种),可处理超一小时音频。官方称在 Artificial Analysis 流式语音转写榜单排名第一(截至 9 月 1 日)。已接入 Meta AI for Mac(按住 Fn 全局听写)、Muse Code,并向 Meta Model API 开放,定价为每 1000 音频分钟 3 美元(约合每小时 0.18 美元)。

核心要点速览 (Key Takeaways)

  • 流式 ASR + 说话人分离 + 端点检测一体,无需后处理拼流水线
  • Mac 全局听写与 Muse Code 已切换到该模型;开发者可走 Meta Model API
  • API 价约 0.18 美元/小时;自适应 delay 在速度与准确率之间动态权衡
ADSponsored