概览
Muse 家族的实时音频感知模型,支持流式语音识别、说话人分离、端点检测和多语言混合输入。
仅展示已有公开资料的规格。
Muse 家族的实时音频感知模型,支持流式语音识别、说话人分离、端点检测和多语言混合输入。
它把 Muse 的能力从多模态推理扩展到实时语音输入,支持超过一小时音频和 20 多位说话人。
Muse Voice Transcribe 发布并在 Meta Model API、Meta AI for Mac 与 Muse Code 提供。
查看原文点击卡片查看相关模型。
暂未收录关联模型