AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

前OpenAI安全VP翁荔发万字长文 质疑大模型Scaling Laws核心共识

前OpenAI安全研究副总裁、现Thinking Machines Lab联合创始人翁荔近日在个人博客发布拖更三年的万字技术长文《Scaling Laws, Carefully》,拆解支撑大模型行业数百亿美元投入的规模定律(Scaling Laws),指出从Kaplan到Chinchilla的主流预训练数据配比并非最优,行业沿用多年的训练路径可能存在根本性偏差,引发全球AI从业者对大模型预训练配方的集体反思。

配图

2026年6月26日,停更13个月的知名AI研究者翁荔的个人博客Lil'Log,上线了一篇超过1.2万字的技术长文,发布仅12小时就被Hugging Face、X平台AI社区等多个行业渠道置顶,不少从业者甚至称这篇文章“可能把整个大模型行业的发展路线掰回半厘米”。

2020年OpenAI研究员Jared Kaplan发布的论文首次提出Scaling Laws,明确在对数坐标系下,大模型的训练损失和参数量、算力、训练数据量呈幂律下降关系,而“参数量增长速度应当快于训练数据增长速度”是这套定律最核心的落地指引。

GPT-3就是这套逻辑的首个标杆产物:1750亿参数的模型仅搭配3000亿Token的训练数据,就实现了当时远超所有竞品的性能表现。后续Google推出的Chinchilla论文虽然对配比做出了微调,但核心逻辑仍然延续了规模优先的思路,过去六年全球大模型厂商累计投入的数百亿美元预训练成本,几乎全部基于这套框架制定研发路线,甚至成了行业通用的“投资说明书”。

翁荔耗时三年梳理了全球27个主流开源、闭源大模型的训练全链路数据,最终得出的结论直接动摇了行业的底层共识:当前通用的“参数优先”配比逻辑完全搞反了两类资源的优先级,高质量训练数据对模型性能的边际增益,实际上是同等量级参数量提升的1.8倍。

她在文中测算,过去三年行业基于错误配比投入的算力资源中,至少有32%属于无效消耗,如果调整为“数据优先”的配比逻辑,完全可以用一半的成本获得比当前更好的模型性能。这也意味着过去几年全行业押注的“堆参数、扩算力”路线,从一开始就存在资源错配的问题。

这篇文章发布后,已经有包括OpenAI、Anthropic在内的多家头部厂商的研究团队公开表示将复盘现有预训练配方,部分中小模型厂商已经开始调整下一代模型的研发规划,优先扩容高质量训练数据集的储备。

不过也有行业人士指出,当前全球算力基建的布局、算力采购的周期都是围绕原有规模定律的节奏制定的,全行业要彻底完成路线调整,至少需要18-24个月的过渡周期,翁荔提出的新配比框架的落地效果,还有待更多实际训练案例的验证。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。