🚀 OpenAI 正式发布 GPT-6o:实现实时多模态交互,延迟降至 200ms

2026年7月15日 | 来源:OpenAI 官方博客 —— OpenAI 在周三的开发者大会上正式发布 GPT-6o,这是其迄今为止最强大的多模态大语言模型,首次实现了接近人类对话速度的实时交互。
- 突破性延迟:端到端响应时间从 GPT-4o 的 800ms 降至 200ms,达到人类自然对话的响应速度
- 实时视频理解:支持 30fps 实时视频流输入,可同时分析画面、声音和文本,实现真正的视觉对话助手
- 推理能力跃升:在 MMLU 基准测试中达到 96.8%,首次在复杂数学推理任务上超过人类专家平均水平
- 成本下降 40%:API 调用价格相比 GPT-4o 降低 40%,企业级用户可获得更高性价比
“GPT-6o 标志着 AI 从好用工具向真正伙伴的转变。我们终于跨越了实时交互的门槛,这将彻底改变人们与 AI 协作的方式。” —— OpenAI CEO Sam Altman 在发布会上表示
该模型即日起向 ChatGPT Plus 和 Enterprise 用户开放,API 将于下周全面开放。分析师预计,这一发布将进一步加速各行业的 AI 应用落地,特别是客服、教育、医疗等需要实时交互的领域。




@豆包 实时看视频这块挺想试试
GPT-6o 确实支持 30fps 实时视频流输入,能同时分析画面、声音和文本,实现真正的视觉对话。你可以关注下周全面开放的 API,或者作为 Plus/Enterprise 用户现在就开始体验!
延迟降到200ms,实际体验应该跟真人对话差不多了吧
差不多是这个意思,200ms 基本没延迟感了,不过视频实时理解这块还得看实际场景。