AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

OpenAI筹备发布GPT-Bidi-1 双向架构升级ChatGPT语音交互体验

2026年6月,OpenAI被曝正筹备推出新一代双向音频模型GPT-Bidi-1,针对ChatGPT现有语音模式完成核心技术升级。该模型采用双向架构突破传统单工对讲限制,可同时实现聆听与表达,实时捕捉用户插话并动态调整语义输出,避免交互卡顿。目前OpenAI已在多端完成基础代码铺设,上线后用户可自主切换新模式。

配图

近日有海外开发者在拆解ChatGPT Web端、移动端的最新版本代码时,发现了数十个标记为“Bidi”的全新功能埋点,此前外界传闻已久的OpenAI下一代语音模型研发进度首次得到侧面印证,距离正式上线已经进入倒计时阶段。

在此之前,包括ChatGPT高级语音模式在内的所有AI语音交互产品,普遍采用“单工对讲”逻辑:用户发言时AI停止输出,AI发言时也无法响应中途的用户输入。如果用户想要打断对话补充信息,往往需要等AI说完一整段内容,或者强行打断后出现卡顿、语义衔接混乱的问题,和真人对话的自然度存在明显差距。根据此前针对C端AI用户的调研,超过6成用户将“不能灵活打断”列为语音交互体验的最大痛点。

GPT-Bidi-1的核心升级就在于采用了双向(Bidirectional)音频架构,彻底打破了单工模式的底层限制。该模型可以在输出语音的同时,同步处理实时输入的用户音频信号,哪怕用户中途插话、打断对话,也能在毫秒级时间内识别用户的新需求,动态调整后续的语义输出,全程不会出现卡顿、重启对话的情况,交互流畅度接近真人对话。

值得注意的是,GPT-Bidi-1还首次在语音侧引入了分级响应机制,设置“高、中、即时”三档模式,用户可以根据自身的网络环境、使用场景,自主选择音质优先还是响应速度优先,适配更多元的使用需求。

从目前的开发进度来看,OpenAI已经完成了Web端、移动端的基础代码铺设,新功能上线后不会替换现有的高级语音模式,而是作为新增的“Bidi(最新)”选项和原有模式并存,用户可以根据自身需求自主切换,不会影响老用户的使用习惯。

语音交互是大模型从生产力工具向普惠AI入口落地的核心场景,GPT-Bidi-1的出现相当于补上了AI语音交互“拟人化”的最后一块短板。业内预计,该技术后续除了服务ChatGPT的C端用户之外,还有望通过API开放给第三方开发者,落地到智能座舱、消费级智能硬件、AI客服等多个场景,进一步拓展大模型的应用边界。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。