问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
AI搜索公司Perplexity近期正式开源自研推理引擎Lily,该引擎基于Rust语言与苹果Metal框架开发,可在Apple Silicon芯片设备上高效运行通义千问Qwen3.6-35B-A3B大模型,解码速度较现有方案提升1.35倍,为消费级端侧部署百亿参数大模型提供了可落地的优化路径。

随着端侧AI需求的爆发,如何在消费级硬件上运行更高参数的大模型,一直是行业探索的核心方向。此前30B以上参数的大模型普遍需要云端算力支持,即便是性能较强的苹果硅设备,运行此类大模型也普遍存在解码慢、内存占用过高的问题,用户体验难以达标。
此次Perplexity推出的Lily推理引擎,针对性解决了苹果生态下大模型推理的效率痛点。不同于多数现有推理工具依赖通用适配方案,Lily基于Rust语言与苹果Metal图形计算框架深度定制,前者自带的内存安全特性与高性能优势可大幅降低推理过程的额外开销,后者则能充分调用Apple Silicon芯片的GPU与神经网络引擎算力,避免硬件资源浪费。
测试数据显示,搭载Lily的苹果硅设备运行Qwen3.6-35B-A3B大模型时,解码速度较现有同场景方案提升1.35倍,同时内存占用控制在合理区间,无需额外的硬件升级即可支撑35B参数大模型的流畅运行。
Perplexity选择将Lily完全开源,也被行业视为端侧AI生态的重要信号。作为全球头部AI搜索服务商,Perplexity本身有着大量的大模型推理优化需求,Lily本身就是其内部技术落地的产物,而非实验室阶段的Demo产品,实用性已经过内部场景验证。
此次开源一方面可以吸引全球开发者参与迭代,进一步扩展Lily支持的大模型范围与硬件适配能力,另一方面也能与Qwen系列大模型的开源生态形成联动,为大量面向苹果用户的AI应用开发者降低技术门槛,无需投入大量资源做底层推理优化,即可快速实现35B级大模型的端侧部署。
此前消费级端侧大模型的普遍适配上限为7B-14B参数,模型能力存在明显天花板,复杂的推理、创作需求仍需依赖云端响应,不仅存在数据隐私风险,也容易受网络环境限制。
Lily的出现打破了这一限制,意味着端侧AI的能力边界将迎来大幅扩展:离线状态下即可运行35B级大模型,不管是需要高隐私性的办公文档处理、个人创意生成,还是行业场景下的离线智能终端,都能获得更强大的AI能力支撑。后续随着更多开发者参与贡献,Lily有望适配更多主流大模型,甚至推动更高参数等级的大模型落地消费级端侧设备。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。