科技与AI

Meta发布实时转录模型Muse Voice Transcribe,API定价每千音频分钟3美元

Meta 9月1日发布实时语音转录模型Muse Voice Transcribe

Engadget于9月1日报道,Meta旗下超级智能实验室(Meta Superintelligence Labs)发布实时音频转录模型Muse Voice Transcribe。按报道,这是该实验室推出的第一款实时音频感知模型,把流式语音识别、说话人分离(diarization)与断句判定合并到同一个模型里完成,不再需要单独的后处理环节。能力口径上,模型可在一段录音中区分20位以上说话人,支持句中与句间的自然语码切换,可处理一小时以上的长音频;训练覆盖70多种语言,发布时已完成验证的有25种。马克·扎克伯格称模型采用自适应延迟策略,会根据词的识别难度自行决定听多久再输出,用等待时间换准确率,而不是固定一个速度与精度的折衷点。落地方式上,该模型已在Meta的Mac端应用与Muse Code中承担听写功能,开发者可通过Meta Model API调用,价格为每1000音频分钟3美元,折合每小时0.18美元。报道同时提到,谷歌在8月下旬已推出能力相近的Gemini 3.5 Transcribe,两家在多说话人与多语种实时转录上正面相遇。

语音转录长期是拼准确率的单点能力,这次值得注意的是交付形态和价格:说话人分离、断句这些过去要靠一串后处理工具拼起来的环节被收进单个模型,等于把一条工程流水线压缩成一次API调用。每小时0.18美元的公开报价,也把实时转录从需要定制集成的项目型能力,变成可以按量采购的基础设施件。对会议记录、客服质检、字幕这类依赖多说话人长音频的场景,成本结构和技术选型的门槛同时被下调。

对Meta而言,模型直接绑定自家Mac应用与Muse Code的听写入口,是把模型能力接到已有产品上,而不是单独卖模型;API定价则是对外的第二条路径。对开发者,原本需要自行拼装的ASR加说话人分离方案,出现了一个按分钟计价的替代项,自建流水线的性价比会被重新评估。对同业,谷歌8月下旬的Gemini 3.5 Transcribe与这次发布相隔不到两周,实时转录已经从少数厂商的专有能力变成大厂标配的竞争面,后续拉开差距的更可能是长音频稳定性、语种覆盖和单位成本,而不是单条基准分数。

后续关注

一是已验证语种从25种向训练覆盖的70多种扩展的节奏;二是每千音频分钟3美元这一价格在竞争下是否松动,以及谷歌等厂商是否给出可对照的公开报价;三是模型是否从Mac端与Muse Code延伸到Meta的其他终端与社交产品;四是第三方在真实嘈杂多人音频上的复测结果,与厂商口径的20位以上说话人是否吻合。

信息来源

  1. Engadget媒体报道 · en · 2026年9月1日发布
  2. Fortune媒体报道 · en · 2026年7月9日发布

GFT Finance 整理归纳公开信息并总结要点,不构成投资建议。数据以来源原文为准。