问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
8月18日,英伟达正式开放TensorRT Model Connect工具公共预览版,该工具可实现仅用两行命令,将Hugging Face平台上的模型检查点直接转换为适配TensorRT的原生C++推理版本,无需经过ONNX中间格式转换,大幅降低大模型生产级部署的技术门槛与时间成本,当前已面向全球开发者开放试用。

随着开源大模型生态的快速扩张,Hugging Face已经成为全球开发者获取预训练模型的核心渠道,仅2026年上半年平台新增模型 checkpoint 数量就突破了230万个。但此前开发者要将Hugging Face上的模型部署到对性能要求极高的生产级C++环境,需要经过权重导出、ONNX格式转换、算子适配、TensorRT优化、精度校验等至少7个步骤,仅兼容性调试环节就可能耗费中小团队3-5天的工时,近6成开发者表示推理部署是AI应用落地过程中耗时最长的环节。
此次推出的TensorRT Model Connect直接砍掉了ONNX中间转换环节,开发者只需执行两行命令,即可完成从Hugging Face模型检查点到原生C++ TensorRT推理包的全流程转换,系统会自动完成算子融合、精度校准、显存优化等专业操作。
根据公开测试数据,该工具的整体转换效率比传统流程提升超过10倍,单个7B参数大模型的转换耗时从平均4小时压缩到20分钟以内,最终生成的推理包运行性能比ONNX转换版本高出15%左右。目前该工具已经支持LLaMA 3、Qwen 2、Mistral等主流开源大语言模型,以及主流计算机视觉、语音识别类模型,后续还将逐步扩展支持更多小众模型架构。
实际上英伟达与Hugging Face的合作由来已久,此前双方已经联合推出了Hugging Face上的TensorRT预优化模型专区,累计下载量已经突破2亿次。此次TensorRT Model Connect的推出,相当于补上了开源模型从训练到生产落地的最后一块拼图,开发者无需再投入大量精力研究底层推理优化逻辑,可直接聚焦上层应用功能开发。
行业分析师指出,当前TensorRT已经占据英伟达GPU推理场景65%以上的市场份额,该工具的普及将进一步拉高开发者对英伟达生态的粘性,同时也会加速AI应用的落地迭代速度,预计2026年下半年基于TensorRT部署的生产级AI应用数量将同比增长80%以上。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。