阶跃星辰开源Step 3.7 Flash大模型 196B参数推理速度翻倍

2026年5月29日,国内大模型厂商阶跃星辰正式发布并开源新一代智能体专用大模型Step 3.7 Flash。该模型采用196B参数稀疏混合专家架构,针对代码编写、多模态处理、联网搜索场景做系统级优化,最高生成速度达每秒400Tokens,较同量级模型效率提升超100%,为国内智能体生产化落地提供了高性价比的底层模型支持。

配图

对重度使用AI工具的开发者、内容创作者而言,大模型响应延迟带来的体验痛点一直十分突出:写百行代码要等七八秒,多轮对话每轮都要卡顿数秒,联网搜索的结果还要等模型交叉验证,这些问题直接制约了智能体类产品走向生产级应用。

过去一年,国内智能体赛道的融资规模突破300亿元,但落地渗透率始终不足15%。行业调研显示,接近四成用户放弃使用智能体产品的核心原因是响应速度过慢。

当前同参数级别的通用大模型,生成速度普遍在每秒180至220Tokens区间,遇到长代码生成、多模态内容解析、多轮联网搜索等高频复杂场景,单次等待时长很容易超过10秒,完全达不到To B端生产环境的响应要求。同时,闭源高吞吐大模型的API调用成本是通用模型的2至3倍,也进一步抬高了中小厂商的落地门槛。

此次发布的Step 3.7 Flash,专门针对智能体生产化落地的需求设计,采用196B参数的稀疏混合专家(MoE)架构,仅激活部分参数处理单条请求,在保留大参数模型能力优势的同时大幅压缩推理耗时,最高生成速度可达每秒400Tokens,较同量级通用大模型效率提升100%以上。

针对智能体的高频使用场景,研发团队还做了三层系统级优化:一是代码能力优化,代码生成准确率较上一代模型提升27%,支持批量生成、断点调试等开发需求;二是原生多模态能力,无需对接额外视觉模型即可直接识别UI界面、图表、文档等复杂视觉信息,可直接将视觉内容转化为结构化数据甚至对应执行代码;三是搜索增强能力升级,支持跨文本、图像的全网信息检索,可自动交叉比对多源信息降低生成幻觉,更适合部署联网类智能体产品。

值得注意的是,Step 3.7 Flash完全开源,开发者可直接下载模型权重进行二次微调,无需支付API调用费用,相较使用闭源高吞吐模型,研发成本可降低70%以上。

从行业发展脉络来看,国内大模型赛道已经从过去两年的“拼参数规模”阶段,逐步转向“拼落地性价比”的新阶段。此次阶跃星辰开源高吞吐智能体专用大模型,填补了国内同类型开源模型的空白,大幅降低了中小开发者、企业部署生产级智能体的门槛。

据行业机构预测,随着这类专用大模型的普及,2027年国内生产级智能体的市场渗透率将从当前的12%提升至40%左右,覆盖研发辅助、客户服务、政务办理、工业运维等多个核心场景。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。