Model index
Meta·Muse

Muse Voice Transcribe

A real-time audio perception model in the Muse family for streaming speech recognition, diarization, endpointing, and multilingual mixed speech.

CurrentLanguageWeights not released
MODEL NUMBER108
Release date
2026-09-01
Organization
Meta
Family
Muse
01

Specifications

Only published specifications are shown.

Input modalities
Audio
Output modalities
Text
Open weights
No
Status
Current
02

Overview

Overview

A real-time audio perception model in the Muse family for streaming speech recognition, diarization, endpointing, and multilingual mixed speech.

Why it mattered

It extends Muse beyond multimodal reasoning into real-time voice input, supporting audio longer than an hour and more than 20 speakers.

03

Architecture & capabilities

Key capabilities

audio transcriptiondiarizationendpointingMultilingualLong context
04

Release history

API launch

Muse Voice Transcribe launched in Meta Model API, Meta AI for Mac, and Muse Code.

View source
05

Related models

Select a card to view the related model.

No related models recorded yet

06

Sources