AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

Perplexity AI开源Rust版Unigram分词器 性能超Hugging Face方案5倍

近日AI搜索企业Perplexity AI宣布开源其基于Rust语言重构的Unigram分词器工具,该方案相较主流的Hugging Face tokenizers crate实现5倍p50延迟降低,CPU占用率下降5-6倍,且运行过程中实现零稳态堆内存分配,可大幅削减大语言模型推理部署的基础算力开销,为AI基础设施层优化提供了新的成熟选型。

配图

作为大语言模型输入输出链路的核心前置组件,分词器的性能直接决定了用户请求的响应速度,但其优化工作长期以来被不少研发团队忽略,直到高并发落地场景的需求爆发,这一“隐形瓶颈”才逐渐走到行业聚光灯下。

现在大模型落地已经从尝鲜阶段进入规模化部署阶段,企业对推理成本的敏感度正在快速提升。此前行业的优化重点大多集中在模型量化、推理引擎加速等环节,而分词器作为所有请求的必经处理环节,其CPU占用和延迟往往会占到整条推理链路的10%到30%,高并发场景下占比还会进一步上升。

目前行业应用最广泛的Hugging Face tokenizers库虽然兼容性强、支持多类分词算法,但受限于架构设计,在生产环境的性能表现始终无法满足头部企业的极致优化需求,不少企业为了消化这部分算力开销,不得不单独扩容服务器节点,直接推高了大模型的落地成本。

Perplexity AI此次开源的Unigram分词器,完全基于Rust语言重写了核心逻辑,针对高并发生产场景做了大量定向优化。官方测试数据显示,该分词器的p50延迟相较Hugging Face同类方案降低5倍,也就是说在同等并发量下,一半的用户请求的分词处理时间仅为原有方案的1/5,能直接缩短整体响应时长。

除此之外,该分词器还实现了CPU占用率下降5-6倍,大幅释放了推理节点的CPU算力,原本用于分词的算力可以全部倾斜给模型推理环节,进一步提升单节点的推理吞吐量。更值得关注的是,该方案实现了零稳态堆内存分配,运行过程中不会产生频繁的内存申请和释放操作,彻底避免了内存碎片化带来的性能波动,长期运行的稳定性也得到了显著提升。

此次Perplexity AI选择完全开源该分词器,所有开发者都可以直接将其集成到自身的大模型部署链路中,无需支付任何费用,也没有开源协议的商业化使用限制。

随着大模型技术的逐渐趋同,全链路的基础设施优化正在成为AI企业新的竞争焦点。不同于此前集中在模型层的创新,基础设施层的优化往往能直接带来全行业的效率提升,进一步降低大模型的落地门槛。

作为AI搜索赛道的头部企业,Perplexity AI本身就有着极高的并发请求处理需求,此次开源的分词器也是其在实际生产环境中打磨已久的成熟方案,后续预计会快速被主流推理框架集成,成为开发者的又一主流选型。而随着更多企业将自身打磨的基础设施工具开源,整个AI行业的部署成本有望在未来1-2年内出现明显下降。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。