2026年3月16日,马斯克旗下人工智能公司xAI正式官宣上线大模型Grok的文本转语音(TTS)API,开发者可直接调用封装了Grok标志性“毒舌”幽默调性的语音能力,集成至智能助理、内容生成等各类应用。该功能的上线补齐了Grok的多模态能力缺口,直接对标OpenAI GPT-4o的语音交互能力,标志着大模型语音赛道竞争进入人格化比拼新阶段。
xAI的官宣动态发布后不到两小时,首批拿到测试权限的开发者就放出了demo片段:让Grok语音朗读一段调侃科技公司“造概念”的文案,输出的语音语调自带玩世不恭的调侃感,尾音甚至带了点类似马斯克本人的拖腔,和市面上常见的中性、平稳的AI语音形成强烈反差,相关内容在社交平台的转发量很快突破10万。
去年OpenAI发布GPT-4o时,其低至300毫秒的语音交互延迟,直接把大模型的竞争维度从文本推理拉到了实时多模态交互。对于C端用户而言,语音是比打字更自然的交互方式,智能硬件、车载系统、AI内容生成等场景,都对成熟的TTS能力有刚性需求。
此前Grok仅支持文本交互,一直是xAI生态的明显短板,此次语音API的上线,也意味着Grok正式具备了和GPT-4o、Gemini等头部大模型正面竞争多模态场景的资格。
和其他厂商的TTS API支持自定义音色、语调不同,xAI此次推出的Grok语音API,直接把其在文本交互阶段就打出的“毒舌”“幽默”的人设封装进了语音模型,开发者无需额外调教语气参数,调用接口即可生成符合Grok统一人格的语音内容。
这种“人设统一”的语音能力,恰好击中了当前AI语音的同质化痛点——市面上绝大多数AI语音都能做到“听起来像人”,但很难有统一的、有记忆点的性格特征,而Grok的语音能力天然适合打造有辨识度的AI助理、虚拟主播等产品。
从整个行业的发展来看,大模型的语音交互早已不是“能不能说话”的问题,而是“能不能在特定场景下说好话”的问题。除了xAI之外,OpenAI、谷歌,以及国内的字节跳动、百度等厂商,都在不断迭代语音相关的API能力,除了人格化调性之外,长文本生成稳定性、特定行业术语的发音准确率、多语种混合切换能力等,都已经成为厂商比拼的核心指标。
有业内分析师指出,2026年将会是大模型语音落地的爆发年,围绕各类场景的“AI嘴替”竞争还会进一步升级。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。