引言:实时语音AI进入推理时代
2026年5月7日,OpenAI通过Realtime API发布了一系列新的音频模型,其中GPT-Realtime-2是绝对核心。GPT-Realtime-2最大的突破不是“说得更像人”,而是让语音代理可以在实时对话中理解、推理、调用工具、翻译和转写。这是语音AI第一次具备GPT-5级别的推理能力,也是实时语音从“工具”升级为“智能助手”的分水岭。
这次更新包括三个模型:GPT-Realtime-2(具备GPT-5级推理能力)、GPT-Realtime-Translate(70+种输入语言实时翻译到13种主流语言)、以及Whisper系列更新。从产品发布节奏看,OpenAI正在把“实时语音”做成一个完整产品线。
核心能力:三大维度重新定义实时语音AI
1. 推理能力:语音对话不再是"单步问答"
GPT-Realtime-2最核心的升级是首次在实时语音中引入GPT-5级推理。这意味着语音AI不再只是“听懂问题→回答问题”,而是能在对话过程中进行多步推理、调用外部工具、保持上下文逻辑。
实测一个复杂场景:“帮我计算一下我上个月在北京三里屯买了多少杯星巴克,如果是常客的话,按金星级会员的折扣算下来一共多少钱”。GPT-Realtime-2能:①调用日历确认上个月日期范围;②定位到三里屯星巴克的位置;③估算购买频次;④调用会员体系查询折扣规则;⑤输出最终金额估算。整个过程完全用语音完成,不需要任何文字输入。
2. 超长上下文:12.8万token的语音记忆
相比前代模型的3.2万token,GPT-Realtime-2的上下文窗口扩展到12.8万token,相当于连续语音对话2-3小时不会"失忆"。这让长会议、长时间客服对话、有声书交互成为可能。
实测中,在45分钟的英语播客连续对话中,GPT-Realtime-2能准确回忆30分钟前提到的细节(人名、数字、观点),错误率