问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
2026年8月3日,马斯克旗下人工智能公司xAI宣布对视频生成模型Imagine Video 1.5完成重大版本升级,新增图像参考、语音参考、纯文本转视频及原生1080p输出能力,可大幅强化角色一致性与场景控制精度。目前文本转视频与1080p功能已全端登陆Grok Imagine,图像、语音参考功能率先向美国SuperGrok Heavy/Plus用户开放。

如果你曾经因为AI生成的视频角色跳脸、分辨率不足、无法匹配特定声线而放弃创作,xAI的最新更新或许能解决这些痛点。8月3日推出的Imagine Video 1.5版本,直接把AI视频创作的可控性拉到了新的层级。
本次更新彻底补齐了Imagine Video系列的多模态输入能力,创作者的选择空间被大幅拓宽:既可以直接通过文字描述生成视频,也可以上传参考图像控制角色、产品或场景的风格特征,还能够结合角色图片与语音样本,让AI在不同镜头中保持外观和声音表现一致。xAI还为参考功能设置了更高的上限,单次生成最多支持7个视觉参考,可以分别锚定人物面部、核心道具、背景环境等不同元素,避免出现此前常见的“角色中途变脸”“道具穿模”等问题。同时本次升级支持的原生1080p输出,也免去了创作者后续二次超分的流程,画面清晰度和色彩还原度都有明显提升。
目前纯文本转视频、原生1080p生成两项功能已经在Grok Imagine的网页端、iOS端、Android端全量上线,所有Grok用户都可以直接使用。门槛更高的图像参考、语音参考功能则率先向美国地区的SuperGrok Heavy、SuperGrok Plus两级付费用户开放,xAI方面表示后续会逐步扩大功能覆盖范围,面向更多区域、更多层级的用户解锁。这种分阶段落地的方式,既保证了付费用户的专属权益,也能通过小范围用户反馈快速迭代模型能力,是xAI推进AIGC工具商业化的典型路径。
近一年来AI视频赛道的竞争早已从“能否生成视频”转向“能否生成可用的商用内容”,此前困扰创作者的分辨率不足、角色一致性差、可控性低等问题,已经成为各家厂商升级的核心方向。xAI本次升级直接瞄准了商用内容创作的核心痛点,不管是多参考锚定的可控性,还是原生1080p的清晰度,都能满足短视频创作、广告片制作、虚拟IP内容生成等场景的基础需求,也进一步推高了行业对AI视频工具的能力预期。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。