原生处理文本、视觉和音频的“omni”模型,显著降低多模态交互延迟。
仅展示已有公开资料的规格。
GPT-4o 让原生多模态从研究能力转为面向大众的实时产品体验。
对比 GPT-4 ↗
GPT-4o 发布,原生统一文本、视觉与音频。
点击卡片查看相关模型。