模型索引
OpenAI·GPT

GPT-4o

原生处理文本、视觉和音频的“omni”模型,显著降低多模态交互延迟。

历史版本语言多模态未开放权重
模型编号004
发布日期
2024-05-13
组织
OpenAI
家族
GPT
01

规格概览

仅展示已有公开资料的规格。

架构
未披露
上下文
128K
输入模态
文本 · 图像 · 音频
开放权重
状态
历史版本
02

概览

概览

原生处理文本、视觉和音频的“omni”模型,显著降低多模态交互延迟。

为什么重要

GPT-4o 让原生多模态从研究能力转为面向大众的实时产品体验。

03

相对前代的变化

对比 GPT-4

前代GPT-4 · 8K ctx
当前GPT-4o · 128K ctx
新增能力 原生多模态 实时音频
04

架构与能力

主要能力

原生多模态视觉理解实时音频
05

发布历史

正式发布

GPT-4o 发布,原生统一文本、视觉与音频。

查看原文
06

相关模型

点击卡片查看相关模型。

07

来源