AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

北大联合DeepSeek开源DSpark 突破大模型推理算力效率瓶颈

2026年6月28日,北京大学与AGI厂商深度求索(DeepSeek)联合发布并开源大模型推理加速框架DSpark,针对当前大语言模型自回归生成流程中算力利用率低、高并发场景延迟高等行业痛点,通过半自回归架构等创新设计实现推理效率跃升,仅两层Transformer结构即可达到传统五层并行模型的优化效果,为大模型规模化落地提供重要技术支撑。

配图

随着大语言模型在C端智能对话、B端企业知识库、生成式内容生产等场景的渗透率持续提升,推理环节的效率短板正在成为限制产业规模化发展的核心瓶颈。据行业公开统计,成熟大模型商用部署过程中,推理成本已经占到整体运营成本的70%以上,高并发场景下的响应卡顿、算力无效消耗问题,始终是头部厂商和开发者共同攻坚的核心方向。

现有主流的推测解码提速方案存在明显的结构性短板:串行生成方案耗时过长无法满足实时交互需求,而并行生成方案在处理长文本、多轮对话等场景时,候选词接受率会出现明显下滑,最高可导致近60%的算力被无效浪费。

此次北大与DeepSeek联合推出的DSpark框架,专门针对自回归生成环节的算力浪费问题设计了双重优化机制。在候选生成阶段,框架创新性采用半自回归架构,通过并行主干网络一次性输出高质量基础特征,再辅以轻量化模块优化文本生成逻辑,仅需两层Transformer结构即可达到传统五层并行模型的候选生成效果,大幅降低了基础算力消耗。

据内测数据显示,在同等算力配置、1000路并发的对话场景下,搭载DSpark的大语言模型平均响应延迟降低42%,整体算力利用率提升48%,长文本生成场景下的效率提升尤为明显。目前该框架已经完全开源,全球开发者和企业均可免费获取、修改并用于商业场景。

推理框架的开源,被视作降低大模型商用门槛的核心举措之一。此前行业内成熟的推理加速方案大多由头部厂商闭源持有,中小研发团队往往需要投入大量人力物力重复造轮子,才能实现可商用的推理效率。

DeepSeek作为国内头部AGI厂商,此前已经开源了通用大模型、代码大模型、数学大模型等多款行业领先的预训练模型,此次联合北大开源推理框架,也进一步补全了其开源技术栈,为开发者提供了从预训练到推理部署的全链路开源工具支持,有望大幅降低大模型的商用门槛,推动更多垂直场景的创新应用落地。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。