问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
2026年6月,OpenAI被曝正筹备推出新一代双向音频模型GPT-Bidi-1,针对ChatGPT现有语音模式完成核心技术升级。该模型采用双向架构突破传统单工对讲限制,可同时实现聆听与表达,实时捕捉用户插话并动态调整语义输出,避免交互卡顿。目前OpenAI已在多端完成基础代码铺设,上线后用户可自主切换新模式。

近日有海外开发者在拆解ChatGPT Web端、移动端的最新版本代码时,发现了数十个标记为“Bidi”的全新功能埋点,此前外界传闻已久的OpenAI下一代语音模型研发进度首次得到侧面印证,距离正式上线已经进入倒计时阶段。
在此之前,包括ChatGPT高级语音模式在内的所有AI语音交互产品,普遍采用“单工对讲”逻辑:用户发言时AI停止输出,AI发言时也无法响应中途的用户输入。如果用户想要打断对话补充信息,往往需要等AI说完一整段内容,或者强行打断后出现卡顿、语义衔接混乱的问题,和真人对话的自然度存在明显差距。根据此前针对C端AI用户的调研,超过6成用户将“不能灵活打断”列为语音交互体验的最大痛点。
GPT-Bidi-1的核心升级就在于采用了双向(Bidirectional)音频架构,彻底打破了单工模式的底层限制。该模型可以在输出语音的同时,同步处理实时输入的用户音频信号,哪怕用户中途插话、打断对话,也能在毫秒级时间内识别用户的新需求,动态调整后续的语义输出,全程不会出现卡顿、重启对话的情况,交互流畅度接近真人对话。
值得注意的是,GPT-Bidi-1还首次在语音侧引入了分级响应机制,设置“高、中、即时”三档模式,用户可以根据自身的网络环境、使用场景,自主选择音质优先还是响应速度优先,适配更多元的使用需求。
从目前的开发进度来看,OpenAI已经完成了Web端、移动端的基础代码铺设,新功能上线后不会替换现有的高级语音模式,而是作为新增的“Bidi(最新)”选项和原有模式并存,用户可以根据自身需求自主切换,不会影响老用户的使用习惯。
语音交互是大模型从生产力工具向普惠AI入口落地的核心场景,GPT-Bidi-1的出现相当于补上了AI语音交互“拟人化”的最后一块短板。业内预计,该技术后续除了服务ChatGPT的C端用户之外,还有望通过API开放给第三方开发者,落地到智能座舱、消费级智能硬件、AI客服等多个场景,进一步拓展大模型的应用边界。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。