问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
2026年7月24日,OpenAI正式宣布升级ChatGPT桌面应用,完成与Codex代码模型的整合后,上线由GPT-Live驱动的全新ChatGPT Voice语音模式。该功能搭载全双工语音技术,支持同时聆听与对话,覆盖聊天、办公、编程三大核心场景,用户可通过语音发起、调整多线程任务,类人交互体验可大幅降低操作门槛,提升多场景生产效率。

早上的部门周会刚结束,你不用对着录音文件逐句转写,只需对着电脑口述“整理刚才的会议纪要,标注核心待办项,同时帮我查询下周去上海的差旅机票”,冲一杯咖啡的功夫,两份任务就已经同时完成——这不是科幻设定,而是ChatGPT桌面端新功能的真实使用场景。
此次上线的ChatGPT Voice功能,核心优势在于打破了此前语音交互“单轮问答、等待响应”的限制。依托全双工语音技术,用户无需等待AI完成当前回复即可随时打断、补充需求,对话体验与真人交流几乎没有差异。
同时由于桌面应用已经完成与Codex代码模型的整合,语音指令可以同时覆盖日常聊天、办公事务处理、代码编写调试三类场景,用户在单条对话线程中即可启动多个并行任务,AI在后台执行任务的过程中,用户还可以继续沟通其他需求。比如开发者可以边口述功能需求,边让AI同步修改代码片段,中间随时调整逻辑,不用反复切换输入方式。
早在2024年,OpenAI就首次为ChatGPT引入了语音识别功能,支持用户通过语音输入替代打字发起需求,但彼时的语音交互仅能实现单轮输入,无法支持连续对话和并行任务处理。
此后两年间,OpenAI持续投入语音大模型研发,最新推出的GPT-Live模型解决了语音实时识别、并行任务调度、上下文语义理解的多重技术难点,才最终实现了此次落地的全双工语音交互能力。OpenAI官方表示,这一功能的落地是其“通用AI助手”愿景的重要一步,未来用户只需自然口述想法,AI就能自主梳理逻辑、拆分任务并同步推进。
此前ChatGPT桌面应用的核心交互方式仍以键鼠输入为主,更多作为网页端的补充存在,而此次语音功能的升级,有望让桌面端成为AI生产力工具的核心入口。
对于高频使用电脑的办公群体、开发者群体而言,语音交互大幅降低了AI工具的使用门槛,多线程任务调度能力也进一步放大了AI的生产效率优势。据行业分析师预测,接下来OpenAI大概率会向第三方开发者开放该语音交互接口,支持第三方SaaS工具接入ChatGPT Voice能力,进一步拓展其应用场景边界。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。