AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

Liquid AI联合Hugging Face发布DSpark模型 推理速度最高提3.18倍

2026年8月21日,Liquid AI与Hugging Face联合发布LFM2.5系列DSpark草稿模型检查点,覆盖1.2B、2.6B、8B-A1B三款参数规格。该模型采用全新投机解码路径,在完全不改变输出质量的前提下大幅提升推理吞吐量,GPU端实测最高提速3.18倍,端侧设备最高提速2.87倍,有效降低端侧智能体应用运行门槛。

配图

在搭载M4Max芯片的MacBook Pro上,运行LFM2.5-2.6B版本DSpark模型的输出速度最高可达每秒139个token,这一数字比此前的常规版本提升了近2倍,而用户拿到的生成内容质量没有出现任何衰减。这也是此次新模型最核心的差异化优势:在不牺牲效果的前提下实现效率翻倍。

此次发布的DSpark草稿模型,核心优化逻辑是新增了投机解码路径,没有改动LFM2.5系列模型的预训练参数和生成逻辑,因此能做到完全不改变输出质量,和原版本模型的生成结果完全一致,解决了过往提速方案往往要牺牲生成效果的普遍痛点。

三款参数的模型分别覆盖不同落地场景:1.2B参数版本适合超轻量级穿戴设备、嵌入式场景,2.6B参数版本是端侧智能体的主流选择,8B-A1B版本则适配云侧中小流量的推理需求,基本覆盖了当前大模型落地的主流部署环境。

实际测试数据显示,GPU端整体吞吐量最高可提升3.18倍,意味着云服务厂商处理同等量级的推理请求,算力成本可降低近三分之二,对成本敏感的ToB大模型应用来说增益显著。

在端侧设备上,提速幅度最高也能达到2.87倍,尤其是在端侧智能体(Agent)的推理场景中,LFM2.5-2.6B版本的函数调用延迟平均降低了57%,完全能满足本地智能体实时交互的需求,大幅降低了端侧AI应用的运行门槛,让普通消费级设备也能流畅运行复杂的AI应用。

长期以来,推理成本高、端侧运行效率低是制约大模型大规模落地的核心瓶颈之一,此前行业的解决方案大多集中在模型量化、剪枝等需要改动模型本身的路径,往往会带来效果衰减的问题。

此次DSpark草稿模型的发布,为行业提供了全新的优化思路,且依托Hugging Face的开源生态,所有开发者都可以免费获取相关模型检查点,无需从零搭建优化框架,有望带动全行业的推理效率提升,推动端侧离线AI应用的普及。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。