Model index
StepFun·StepAudio

StepAudio 3

StepFun’s current audio product group spanning ASR, realtime voice interaction, voice generation, TTS, and music generation.

CurrentLanguageMultimodalWeights not releasedRelease group
MODEL NUMBER347
First public date
Unverified
Organization
StepFun
Family
StepAudio
01

Specifications

Only published specifications are shown.

This record covers multiple tiers. Modalities and capabilities describe the group coverage; support and licensing depend on the individual tier.

Input modalities
Text · Audio
Output modalities
Text · Audio
Open weights
No
Status
Current
StepAudio 3 ASR · in: Audio · out: TextStepAudio 3 Realtime · in: Text/Audio · out: Text/AudioStepAudio 3 Gen · in: Text/Audio · out: AudioStepAudio 3 TTS · in: Text · out: AudioStepAudio 3 Music · in: Text/Audio · out: Audio
02

Overview

Overview

StepFun’s current audio product group spanning ASR, realtime voice interaction, voice generation, TTS, and music generation.

Why it mattered

StepAudio 3 brings speech recognition, realtime conversation, and audio generation into one product generation.

03

Architecture & capabilities

Model capabilities

Native audioReal-time audio
04

Release history

05

Related models

Select a card to view the related model.

No related models recorded yet

06

Sources

Suggest a correction

Copy this template, add the field, proposed value, and primary source, and share it with the archive maintainer.