AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

博士生团队推出大模型竞技场排行榜 成LLM行业核心评测基准

由多名AI方向博士生创立的平台Arena推出的大模型竞技场排行榜,目前已成为全球AI产业认可度最高的大语言模型(LLM)评测基准之一。该团队近期做客科技媒体TechCrunch旗下播客节目《Equity》,详解榜单搭建逻辑,回应行业关切的中立性质疑,并透露了面向对话机器人之后的下一代AI产品的评测规划。

进入2024年以来,全球大语言模型的迭代速度已经从按年更新缩短到按月更新:OpenAI上半年接连推出GPT-4o、GPT-4o mini,Anthropic发布Claude 3系列,国内厂商DeepSeek、字节跳动等也先后上线新一代大模型,几乎每款产品发布时,都会拿出一长串跑分数据宣称自己是“同参数级第一”,但普通用户和开发者往往很难判断这些数据的含金量。

长久以来,大模型评测主要依赖MMLU、GSM8K等固定基准数据集,但这类公开数据集很容易被厂商针对性“刷分”,最终跑出的分数和实际用户体验脱节。此前也有多家科技厂商、行业机构推出过自家的大模型排行榜,但要么评测维度单一,要么本身就有大模型业务,公信力难以获得全行业认可。

正是在这样的空白下,几名原本在高校从事大模型对齐研究的博士生,在科研过程中搭建的Arena大模型竞技场,意外成了行业通用的评测标尺。

和传统固定数据集评测不同,Arena采用的对战式盲评机制是其获得认可的核心原因:评测时系统会随机抽取两个大模型对同一问题的回答,隐去品牌信息后交给标注员或普通用户投票选择更优答案,最终以累计胜率作为模型的排名依据,从机制上避免了刷分的可能。

目前该榜单已经覆盖超过70款主流商用、开源大模型,累计完成超1200万次有效对战评测,不管是头部的GPT-4o、Claude 3 Opus,还是垂直领域的代码大模型、开源小模型,都能在榜单上找到对应排名,不少开发者甚至会把Arena的排位作为选型的核心参考。

针对行业关注的中立性问题,团队也在播客中明确表态:平台不接受任何大模型厂商的商业赞助,所有运营成本来自高校科研基金和非营利机构捐赠,不会为任何厂商调整评测规则、优化排名结果,确保榜单的独立性。

目前Arena的评测体系主要围绕对话类大模型展开,而随着多模态AI、AI Agent、具身智能等新产品形态的落地,仅针对文本对话的评测已经无法满足行业需求。

团队透露,下一步将首先上线多模态大模型评测赛道,覆盖图文生成、视频理解、3D内容创作等维度的能力评测,后续还将针对AI Agent的任务完成能力、具身智能的实体操作能力打造专属评测体系,构建覆盖全品类AI产品的中立评测网络,为产业发展提供更清晰的参考坐标系。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。