AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

小米MiMo联合TileRT 万亿参数大模型消费级GPU推理破千token每秒

近期小米推出的MiMo-V2.5-Pro-UltraSpeed大模型推理框架,联合推理编译优化工具TileRT,依托FP4量化技术与DFlash投机解码算法,首次在消费级通用GPU平台上实现万亿参数大模型单轮解码速度突破每秒1000token,大幅降低超大规模大模型的落地部署门槛,为端侧、边缘侧运行超大规模大模型提供了可行的技术路径。

配图

过去三年,大模型参数规模从百亿级快速跃升至万亿级,效果提升的同时也带来了算力成本的暴涨。行业公开数据显示,万亿参数大模型若采用传统推理方案,单卡每秒解码速度仅能达到30-50token,且必须使用单卡成本超过8万元的A100级别专业算力卡,仅算力成本就阻碍了超大规模大模型在下沉场景的落地。

对于绝大多数中小开发者、ToB服务提供商而言,动辄数百万的算力集群投入几乎不可能承担,而端侧、边缘侧对数据隐私要求较高的场景,也不可能依赖云端大模型提供服务,行业一直在寻找兼顾成本、速度、效果的超大规模大模型推理方案。

此次小米拿出的解决方案核心是“量化+算法+编译”的三层协同优化。首先是FP4低比特量化技术,在模型效果损失小于1%的前提下,将万亿参数大模型的显存占用压缩至原有水平的1/8,原本需要4张专业卡才能装载的模型参数,现在可以全部装进单张售价不足万元的消费级GPU显存中,从底层解决了超大规模大模型的运行载体问题。

其次是自研的DFlash投机解码算法,打破了传统大模型解码的串行逻辑,通过提前预判后续token的生成概率,将多步推理并行处理,减少了显存访问的频次和延迟,配合TileRT推理编译工具对算子的定向优化,最终实现了每秒1024token的解码速度。这一速度是当前同类消费级GPU运行万亿参数大模型最好成绩的3倍以上,甚至超过了多数专业算力卡的常规推理效率,每秒生成的内容接近800个汉字,远高于普通人的平均阅读速度。

该技术突破的价值不止于算力成本的下降,更打开了超大规模大模型端侧运行的想象空间。按照当前的技术迭代速度,未来2-3年内,万亿参数大模型很可能可以直接运行在高端手机、智能汽车、智能家居设备的本地芯片上,用户不需要上传数据到云端就能获得堪比GPT-4级别的AI服务,数据隐私性、交互延迟都会得到本质改善。

作为拥有手机、汽车、全屋智能全场景生态的科技公司,小米大概率会率先将该技术落地到自有产品体系中,后续也不排除开源相关框架的可能,进一步降低全行业使用超大规模大模型的门槛,推动AI能力从云端向端侧的全面下沉。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。