All families

FAMILY / STEPFUN

StepAudio

StepFun’s audio line spanning Step-Audio 2, audio reasoning, and StepAudio 3 for realtime interaction, recognition, and generation.

First model
2025
Models
5
Latest dated version
Step-Audio-R1.5

01 / RELEASE SEQUENCE

Family release sequence

Compare versions →
  1. First date unverifiedStepAudio 3Language · Multimodal
  2. 2025-07-23Step-Audio 2Language · Reasoning
  3. 2025-11-27Step-Audio-R1Language · Reasoning
  4. 2026-01-14Step-Audio-R1.1Language · Reasoning
  5. 2026-04-29Step-Audio-R1.5Language · Reasoning
5 versions
What changed ↓

02 / GENERATIONS

What changed

01

StepAudio 3

StepAudio 3 brings speech recognition, realtime conversation, and audio generation into one product generation.

02

Step-Audio 2

Step-Audio 2 moved StepFun’s speech capability into reproducible open weights and inference code.

03

Step-Audio-R1

Step-Audio-R1 extends StepFun’s reasoning line from text and vision to audio understanding.

04

Step-Audio-R1.1

The open-weight update to Step-Audio-R1, with inference code and weights released on 2026-01-14 in the official repository.

05

Step-Audio-R1.5

The audio-reasoning research update to Step-Audio-R1, with a technical report and accompanying evaluation benchmarks released on 2026-04-29.