2026年4月14日,谷歌正式为旗下通用AI助手Gemini推出基于Nano Banana技术的交互式可视化生成功能,实现了AI生成可视化内容从静态单帧图像到动态可交互模拟的跨越。此前Anthropic曾在今年3月为Claude推出同类交互功能,谷歌此次新功能在交互深度与信息承载力上形成差异化优势,可支持用户对生成的动态模拟进行多维度实时调整操作。
在功能发布后的首轮第三方测试中,有体验者输入指令“向我展示月球绕地运行的过程”,不到十秒,Gemini就输出了一个带控制滑块的交互模块——除了自动运转的地月系统动画,用户还可以拖动滑块改变公转速度,切换地心观测、空间观测等不同视角,甚至拖动月球改变轨道位置,直观看到引力变化带来的轨道改变。
随着大语言模型的文本、图像生成能力逐渐进入同质化竞争,多模态交互的场景化能力成为头部厂商比拼的新焦点。对于复杂逻辑、动态过程类内容,传统静态图像或预渲染动画只能传递固定信息,无法满足用户自主探索、调整参数的需求,交互式可视化正是瞄准这一痛点推出的新功能。今年以来,海外头部AI厂商已经先后布局这一方向,Anthropic在3月率先为Claude上线同类功能,谷歌此次更新也意味着大厂在该赛道的竞速进一步提速。
和传统静态图像生成最大的差异,在于Nano Banana技术改变了AI的输出逻辑。传统AI图像生成输出的是固定的像素文件,即便生成动图也只是预渲染的帧序列,用户无法进行二次调整。而基于Nano Banana技术的新功能,会在理解用户需求后生成一段轻量可运行的数字模拟程序,直接在Gemini对话界面运行,用户通过点击、拖拽就能完成操作。
除了天体运行类场景,用户查询汽车引擎工作原理时,Gemini生成的交互模块支持手动暂停动画、拆解引擎部件,用户可以逐个观察活塞、火花塞、气门的运动过程,还可以调整转速观察不同工况下的工作差异。这种输出方式的信息承载力,是传统静态生成的数倍,对于需要分步拆解理解的复杂知识,交互演示的认知效率提升非常明显。目前谷歌的核心优化方向,就是把原本数十MB量级的交互程序压缩到了可在浏览器端秒开的轻量量级,不会给普通用户的设备带来过多负担。
在基础大模型能力趋同的当下,场景化落地能力已经成为决定AI产品用户粘性的核心。交互式可视化功能的推出,不仅仅是大模型多模态能力的小升级,更打开了一批之前难以触达的新场景。对于K12和高等教育的科普教学来说,老师可以用自然语言快速生成对应知识点的交互教具,学生也可以自己生成模拟内容动手探索,大幅降低了互动教学的门槛;对于工业设计、科研演示来说,从业者不需要专业编程能力就能快速生成可交互的方案演示模型,缩短了数天的制作周期。
当然,目前该功能仍然处于逐步推送的阶段,也面临不少需要完善的问题:比如复杂系统生成的准确率还有待提升,部分涉及专业公式的模拟偶尔会出现参数错误,生成速度也会随着模拟复杂度提升而明显下降。不过业内普遍认为,从生成静态内容到生成可交互的动态模拟,是大模型从“内容输出”转向“工具生成”的重要一步,后续预计会有更多厂商跟进布局,推动AI交互方式进一步进化。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。