2026年4月,谷歌AI研究团队正式推出基于大语言模型(LLM)的新型技能测评方法Vantage,瞄准教育领域长期存在的痛点——协作、创造力、批判性思维等“持久技能”一直缺乏可扩展、严谨有效的评估工具。Vantage通过大语言模型模拟真实团队互动,平衡了测评的真实感与可重复性,弥补了传统测试及过往方案的不足,为软技能评估提供了新的技术路径。
从升学考试到企业招聘笔试,传统标准化测评可以准确测量测评对象对知识点的掌握程度——你是否掌握了微积分公式,能不能读懂复杂文本,这些都可以通过固定题型给出清晰评分。但对于越来越受重视的协作沟通、创意产出、批判性分析等能力,传统测试几乎无能为力。
这些能力被谷歌研究团队称为“持久技能”,是个人在长期工作生活中更核心的竞争力,但持久技能的测评一直被困在两难矛盾里:要获得贴近真实场景的测评结果,就得用真人互动,不仅成本高,结果也没法重复和横向对比;如果追求测评的严谨性和可重复性,就得像PISA 2015的协作问题解决评估那样,用固定脚本和选择题控制变量,又会失去真实互动的质感,测评结果参考价值大打折扣。
谷歌研究团队此次推出的Vantage,就是瞄准这一矛盾给出的大语言模型原生解法。Vantage的核心是“执行LLM”架构,利用单一大语言模型生成测评场景中所有角色的互动内容,既能模拟出真实团队协作中意见分歧、思路碰撞的自然状态,让测评对象身处接近真实的协作场景中发挥能力,又能保证整个测评过程的规则统一,结果具备可重复性和可比性,刚好实现了生态有效性与心理测量学严谨性的平衡。
不同于传统测试只能测评静态知识,Vantage可以全程记录测评对象的互动过程,从协调分歧、提出创见到批判性反思的全流程表现都可以被系统量化评分,从技术层面解决了传统测评无法覆盖软技能的核心痛点。
目前Vantage还处于研究推出阶段,但其应用前景已经受到业内关注。除了K12和高等教育领域的学生能力评估外,这项技术还可以延伸到企业招聘、人才培养等场景——当前企业群面等软测评方式不仅成本高,也容易受面试官主观因素影响,Vantage如果成熟,就可以实现大规模、标准化的软技能批量测评,大幅降低测评成本,提升评估准确性。
当然,这项技术也仍待进一步验证:大语言模型本身的偏见会不会影响评分公平性,模拟场景和真实场景的差异会不会影响测评结果,这些问题都需要后续更多真实场景测试来优化解答。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。