问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
2026年4月16日,谷歌DeepMind公布最新AI视觉领域研究成果TIPSv2,瞄准当前视觉-语言大模型“全局理解强、局部定位弱”的行业通病。该技术基于研究发现的“小参数量学生模型精细分割表现反超大教师模型”结论改进训练方案,可帮助AI精准定位图像局部细节,解决了领域内长期悬而未决的精细分割难题。
如果你问AI“这张图片里有什么”,大多数主流视觉大模型都能答得头头是道,但如果追问一句“图里那只熊猫的左后腿在哪个位置”,多半会得到含糊不清的回答。这个看似简单的问题,已经困扰视觉-语言大模型领域多年。
当前主流视觉-语言大模型在全局语义理解任务上已经逼近甚至超越人类水平,无论是概括图片内容还是完成通用图文问答,表现都可圈可点。但只要涉及需要精准定位的细粒度任务,现有模型的短板就会立刻暴露——这种“全局强、局部弱”的特征,并非某款模型的个别问题,而是整个领域的共性痛点。
谷歌DeepMind研究团队在调研中发现了一个反直觉的现象:在精细分割任务上,参数量更少的“学生模型”,表现居然经常碾压体量更大的“教师模型”。深挖原因后团队找到问题核心:知识蒸馏过程移除了传统预训练的遮盖机制,迫使模型学习整张图像的所有细节,形成了有效的“全区域监督”,而传统大模型的训练机制天生缺少对未遮盖区域局部细节的监督。
基于这一核心发现,谷歌DeepMind团队推出了专门解决局部识别难题的TIPSv2方案,围绕全区域监督做出了多项关键改进。其中最核心的调整就是全新的iBOT++预训练框架,改变了传统预训练仅对遮盖区域计算损失的规则,将监督覆盖到了图像的每一个区域,迫使模型在训练阶段就关注所有局部细节的语义信息。
测试结果显示,经过TIPSv2训练后的视觉-语言大模型,已经能够精准完成“定位熊猫左后腿”这类细粒度任务,彻底改变了过去AI只是“扫一眼”图片、只能理解全局语义的状态,真正实现了对图像细节的精准感知。
TIPSv2的突破不止解决了一个学术难题,更为AI视觉的落地打开了新的空间。在医疗影像分析中,精准分割病灶边缘是AI辅助诊断的核心前提;在工业质检领域,识别微小的零件缺陷也依赖模型对局部细节的感知能力;在AIGC图文交互场景,用户对图像局部修改的指令也需要AI精准定位对应区域。
这项研究也打破了大模型领域“唯参数量论”的误区,证明通过优化训练逻辑,完全可以在现有架构基础上解决长期存在的性能短板,为后续大模型的技术迭代提供了新的方向。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。