AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

英伟达发布开源PAIR路由 实现跨设备本地AI推理负载调度

近日,英伟达正式推出开源虚拟推理路由工具Personal AI Router(简称PAIR),该工具可将用户发起的本地AI推理请求,自动分布式调度至RTX消费级显卡、DGX Spark算力设备以及Mac节点三类硬件资源,大幅降低本地运行大语言模型、生成式AI应用的算力门槛,进一步完善英伟达面向消费端的本地AI生态布局。

配图

随着生成式AI应用的普及,越来越多用户选择在本地部署大模型以规避数据泄露风险,但单设备算力不足始终是消费级用户面临的核心瓶颈——哪怕是顶配的RTX4090显卡,运行70B参数级的开源大模型时,推理速度也很难满足日常交互需求。

过去一年,开源大模型的精度提升速度远超消费级硬件的迭代速度,Llama 3、Qwen 2等标杆开源模型的70B参数版本,已经能满足绝大多数个人用户、小型团队的办公、创作需求,但这类模型对硬件的要求也水涨船高,单张消费级显卡很难流畅运行。

不少资深AI玩家会同时持有多台算力设备:台式机搭载RTX 4090显卡用于跑AI生成任务,MacBook用于日常办公,部分小型工作室还会采购DGX Spark作为公共算力池,但此前这些设备的算力相互孤立,无法协同完成同一个推理任务,造成了大量算力闲置。PAIR的推出正是瞄准了这一空白市场。

PAIR目前已原生支持三类硬件节点:分别是搭载CUDA核心的RTX系列消费级显卡(覆盖20系至40系全系列产品)、面向小型团队的轻量化DGX Spark算力设备,以及搭载Apple Silicon芯片的Mac系列产品。用户只需在同一局域网内的所有设备上安装PAIR客户端,工具即可自动识别所有可用算力资源。

在执行推理任务时,PAIR会根据任务的参数规模、时延要求,自动拆分计算负载分配到不同节点,无需用户手动配置。实测数据显示,使用单张RTX 4090运行70B参数大模型时,token生成速度约为每秒8个,搭配一台M2 Ultra Mac协同调度后,速度可提升至每秒11个以上,性能提升近40%。该工具已完全开源,开发者可自由修改代码适配更多硬件架构,比如AMD显卡、Arm架构嵌入式算力设备等。

对于英伟达而言,PAIR的推出是其消费级AI生态的重要补充:此前英伟达已经通过CUDA生态、RTX加速SDK为本地AI应用提供了底层支持,而PAIR解决了用户侧算力碎片化的问题,让存量硬件的利用率大幅提升。据行业人士预估,PAIR普及后,消费级用户运行本地大模型的平均算力成本可降低30%以上。

接下来英伟达还计划将PAIR与旗下的AI Agent开发框架、ChatRTX工具链打通,未来用户使用本地AI应用时,无需关心背后的算力来源,只要处于同一网络环境下,即可获得最优的推理性能,进一步缩小本地AI与云端API的体验差距。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。