问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
近日,英伟达正式推出参数规模达34B的开源视觉-语言-动作(VLA)模型Alpamayo 2 Super,该模型采用OpenMDW-1.1商用许可协议开放,核心面向Robotaxi、高阶自动驾驶等场景研发,可实现多模态感知、自然语言交互与决策动作的端到端打通,是目前自动驾驶领域参数规模最大的开源VLA模型之一。

2026年上半年,高阶自动驾驶落地进入关键窗口期,行业对端到端大模型的需求持续攀升,但此前市场上的VLA模型普遍存在参数规模不足、商用限制严格等问题,难以满足Robotaxi等场景的复杂决策需求。
不同于传统自动驾驶“感知-预测-决策-执行”的分体式架构,VLA(视觉-语言-动作)模型可以直接将多模态感知数据、自然语言指令映射为车辆的控制动作,大幅简化系统链路,降低延迟。
此前行业内公开的VLA模型多为10B参数以下的轻量版本,复杂场景下的决策准确率不足85%,且多数采用非商用开源许可,车企和自动驾驶厂商无法直接用于量产项目,自研同级别大模型的成本往往超过千万元,中小玩家门槛极高。
英伟达此次推出的Alpamayo 2 Super,将公开可用的自动驾驶VLA模型参数上限提升到了34B,测试数据显示,其在城市场景的复杂决策准确率达到96.2%,应对加塞、无保护左转等高频难点场景的表现超过行业平均水平27%。
更关键的是,该模型采用OpenMDW-1.1商用许可开放,开发者只需要遵守基础的署名要求,即可将模型用于商用项目,无需额外支付授权费用。同时Alpamayo 2 Super已经完成与英伟达Orin、Thor自动驾驶计算平台的适配,厂商部署时无需额外做硬件适配,可直接基于自有数据做场景微调。
除了常规的驾驶决策能力外,该模型还支持乘客通过自然语言发出调整指令,比如“绕开前方施工路段”“停到右侧便利店门口”等,系统可以直接理解指令并转化为驾驶动作,无需人工接管。
此前自动驾驶大模型的研发主要集中在头部车企和Robotaxi厂商手中,技术壁垒高企,行业落地进度不及预期。英伟达此次开放商用级VLA模型,相当于为全行业提供了成熟的底座能力,厂商无需从零开始训练大模型,仅需针对自有运营场景做少量微调即可投入使用,测算显示可降低相关厂商60%以上的大模型研发成本。
行业分析师预计,随着这类高参数开源VLA模型的普及,2027年国内高阶辅助驾驶的渗透率将突破40%,Robotaxi的规模化运营也将在2-3年内进入爆发期。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。