AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

字节筹备5万亿参数超大模型 张一鸣明确要求严禁蒸馏训练

字节跳动正筹备训练参数规模超5万亿的超大语言模型,该参数规模超过月之暗面K3的2.8万亿、阿里Qwen 3.8-Max的2.4万亿,为目前国内已知规划中参数规模最高的大模型。项目目前处于早期阶段,由Seed Foundation负责人项亮与预训练数据负责人沈科牵头推进,字节创始人张一鸣内部明确要求严禁模型蒸馏,坚持长期主义研发路线。

配图

---

2026年以来,国内大模型行业的竞争已经从“有没有”转向“强不强”,头部厂商的主力模型参数普遍落在2-3万亿区间,不管是微调技巧还是榜单表现,都已经陷入瓶颈,很难和竞品拉开实质性差距。8月初,字节跳动的新模型规划被内部曝光,迅速引发行业关注,其核心逻辑是直接跳出了现有竞争区间,试图用数倍于同行的参数规模,直接建立代差优势。

据了解,这款规划中的5万亿参数大模型如果顺利落地,将成为国内参数规模最大的大语言模型,远超当前公开的参数最高的两款产品:月之暗面Kimi K3的2.8万亿参数、阿里Qwen 3.8-Max的2.4万亿参数。

项目目前尚处于早期筹备阶段,最终是否会对外发布仍存在不确定性。当前该项目由字节Seed Foundation负责人项亮牵头,联合大语言模型预训练数据负责人沈科共同推进,Seed部门已经启动组织重组工作,正在重新划分职责、调配算力和数据资源,为后续的训练工作做准备。

接近项目的内部人士透露,字节之所以选择直接跳级到5万亿参数规模,核心逻辑是“避免在同行已经布局成熟的参数区间内卷”,与其投入大量资源追赶现有竞品的表现,不如直接把参数规模推高到行业数倍,争取一次拿到长期领先的位置。

这次大模型的路线选择,背后是字节高层的明确态度支撑。创始人张一鸣在近期的内部会议中罕见就大模型研发路线表态,要求团队坚持长期主义、延迟满足感,不能靠用其他模型的输出蒸馏来换取短期的榜单排名好看。

张一鸣同时明确要求,字节大模型研发要愿意为长期目标牺牲一部分短期收益,不需要为了赶发布节奏、抢市场声量降低研发标准,这也是国内头部厂商中首次有人明确将禁止蒸馏写进内部研发要求。

5万亿参数模型的训练,对算力、数据质量都有极高的要求,仅训练阶段的算力投入就将达到数十亿级别,这也是字节内部没有给出明确上线时间表的核心原因。

业内分析认为,超大规模预训练模型如果能配套高质量的训练数据,有可能在推理能力、多模态理解、复杂任务处理上出现质的提升,但也有观点认为,大参数并不等同于强能力,后续字节的研发进展能否符合预期,仍然有待观察。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。