问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
2026年8月21日,Liquid AI与Hugging Face联合发布LFM2.5系列DSpark草稿模型检查点,覆盖1.2B、2.6B、8B-A1B三款参数规格。该模型采用全新投机解码路径,在完全不改变输出质量的前提下大幅提升推理吞吐量,GPU端实测最高提速3.18倍,端侧设备最高提速2.87倍,有效降低端侧智能体应用运行门槛。

在搭载M4Max芯片的MacBook Pro上,运行LFM2.5-2.6B版本DSpark模型的输出速度最高可达每秒139个token,这一数字比此前的常规版本提升了近2倍,而用户拿到的生成内容质量没有出现任何衰减。这也是此次新模型最核心的差异化优势:在不牺牲效果的前提下实现效率翻倍。
此次发布的DSpark草稿模型,核心优化逻辑是新增了投机解码路径,没有改动LFM2.5系列模型的预训练参数和生成逻辑,因此能做到完全不改变输出质量,和原版本模型的生成结果完全一致,解决了过往提速方案往往要牺牲生成效果的普遍痛点。
三款参数的模型分别覆盖不同落地场景:1.2B参数版本适合超轻量级穿戴设备、嵌入式场景,2.6B参数版本是端侧智能体的主流选择,8B-A1B版本则适配云侧中小流量的推理需求,基本覆盖了当前大模型落地的主流部署环境。
实际测试数据显示,GPU端整体吞吐量最高可提升3.18倍,意味着云服务厂商处理同等量级的推理请求,算力成本可降低近三分之二,对成本敏感的ToB大模型应用来说增益显著。
在端侧设备上,提速幅度最高也能达到2.87倍,尤其是在端侧智能体(Agent)的推理场景中,LFM2.5-2.6B版本的函数调用延迟平均降低了57%,完全能满足本地智能体实时交互的需求,大幅降低了端侧AI应用的运行门槛,让普通消费级设备也能流畅运行复杂的AI应用。
长期以来,推理成本高、端侧运行效率低是制约大模型大规模落地的核心瓶颈之一,此前行业的解决方案大多集中在模型量化、剪枝等需要改动模型本身的路径,往往会带来效果衰减的问题。
此次DSpark草稿模型的发布,为行业提供了全新的优化思路,且依托Hugging Face的开源生态,所有开发者都可以免费获取相关模型检查点,无需从零搭建优化框架,有望带动全行业的推理效率提升,推动端侧离线AI应用的普及。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。