Overview
A real-time audio perception model in the Muse family for streaming speech recognition, diarization, endpointing, and multilingual mixed speech.
A real-time audio perception model in the Muse family for streaming speech recognition, diarization, endpointing, and multilingual mixed speech.
Only published specifications are shown.
A real-time audio perception model in the Muse family for streaming speech recognition, diarization, endpointing, and multilingual mixed speech.
It extends Muse beyond multimodal reasoning into real-time voice input, supporting audio longer than an hour and more than 20 speakers.
Muse Voice Transcribe launched in Meta Model API, Meta AI for Mac, and Muse Code.
View sourceSelect a card to view the related model.
No related models recorded yet