模型索引
SpaceXAI·Grok

Grok Voice Transcribe 2.0

SpaceXAI 面向批处理与实时流式语音识别的转写模型,强化多语言、说话人分离、时间戳和嘈杂真实场景准确性。

当前版本语言未开放权重

Grok Voice Transcribe 2.0 已在 Speech-to-Text API 提供并成为默认型号;1.0 仍可用但将于未来数周弃用。

模型编号121
首次公开日期
2026-09-17
组织
SpaceXAI
家族
Grok
01

规格概览

仅展示已有公开资料的规格。

输入模态
音频
输出模态
文本
开放权重
状态
当前版本
02

概览

概览

SpaceXAI 面向批处理与实时流式语音识别的转写模型,强化多语言、说话人分离、时间戳和嘈杂真实场景准确性。

为什么重要

它把 Grok Voice 的音频基础模型能力扩展为独立转写 API,并在不改变现有接口的情况下替换首代转写型号。

03

与前代的规格对照

对比 Grok Voice Transcribe 1.0

前代Grok Voice Transcribe 1.0 · ctx
当前Grok Voice Transcribe 2.0 · ctx
04

架构与能力

模型能力

语音转写实时音频说话人分离语音端点检测多语言
05

发布历史

API 上线

SpaceXAI 在 9 月 17 日将 Grok Voice Transcribe 2.0 上线 Speech-to-Text API,并宣布它将成为默认转写型号;Grok Voice Transcribe 1.0 进入弃用过渡。发布文章日期为 9 月 18 日。

查看原文
06

相关模型

点击卡片查看相关模型。

07

来源

建议修正这条记录

复制下方模板,补上字段、建议值和一手来源后发给资料维护者。