AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

国内首份高考志愿AI测评基准发布 千问多项能力超人类咨询师

2026年6月23日,专注人工智能与教育决策研究的独立团队友松实验室发布国内首份《高考志愿AI测评基准》。本次测评以基于夸克8年高考服务数据打造的千问高考志愿填报Agent为核心对象,对照由53名平均从业年限4.6年的志愿咨询师组成的人类对照组,结果显示千问在稳定性、精确性等多维度达到并部分超过人类咨询师水平,填补了高考志愿场景AI能力评估的标准空白。

配图

进入6月下旬,全国各省市陆续公布高考分数,志愿填报成为千万考生家庭的核心需求。近年随着大模型技术落地,各类AI志愿填报工具快速涌现,但由于缺乏统一的能力评估标准,产品质量参差不齐,“AI乱推荐导致考生滑档”的案例屡见不鲜,行业亟需一套可量化的评估体系划定AI工具的能力边界。

作为长期深耕大模型能力评估、教育场景AI应用领域的独立研究团队,友松实验室的研究成果此前已被多所国内高校、科研机构采用。本次推出的《高考志愿AI测评基准》,是国内首个针对高考志愿填报场景的AI能力评估体系,核心目标是为快速迭代的高考志愿AI产品建立一套公开、可复现、可扩展的评估规则,明确AI在志愿填报场景中能够承担的任务范围,也为考生和家长选择相关工具提供参考依据。

之所以选择千问高考志愿填报Agent作为首个测评对象,友松实验室在报告中解释,该产品基于夸克积累8年的高考服务数据与运营经验构建,在产品成熟度、数据覆盖范围、用户规模上均具备行业代表性,测评结果具备普适参考价值。

本次测评设置了稳定性、精确性、结构化表达、服务效率四大核心维度,人类对照组由来自全国多个省市的53名资深志愿咨询师组成,平均从业年限达4.6年,代表了国内志愿咨询行业的平均服务水平。

测评结果显示,千问的综合表现已经达到人类咨询师的平均水平,部分维度优势明显:在稳定性层面,针对同一位次、相同报考需求的多次咨询,千问给出的方案一致性超过98%,远高于人类咨询师82%的平均一致性;在效率层面,千问完成一份包含院校梯度、专业适配、就业前景分析的完整志愿方案仅需2分钟,而人类咨询师平均耗时超过35分钟;此外在往年投档线匹配、政策规则解读的精确性上,千问的出错率比人类对照组低22%。

报告同时也明确了当前AI志愿工具的能力边界:AI生成的方案仅能作为决策参考,无法替代考生和家长结合个人兴趣、职业规划、家庭资源做出的个性化选择。友松实验室透露,后续这套测评基准还将逐步覆盖市面上更多主流AI志愿填报产品,定期向公众发布测评结果,推动行业规范化发展。

在业内人士看来,本次测评的发布不仅是高考志愿场景的一次标准落地,更代表了大模型在垂直教育决策场景的评估体系走向成熟。未来这套评估框架还可延伸到学业规划、专业选择、职业发展咨询等多个教育相关的决策场景,为AI在教育领域的合规落地提供支撑。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。