AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

原生多模态大模型LongCat-Next开源 重构AI跨模态感知底层逻辑

2026年6月4日,原生多模态大模型LongCat-Next及配套离散分词器正式开源。该产品针对当前大模型普遍采用的“语言为核心、外挂视觉/语音模块”的拼凑式异构架构痛点,创新性采用DiNA离散原生自回归架构,实现多模态信息同源建模,让AI可像处理文本一样原生理解视觉、语音信息,打破跨模态技术壁垒。

如果你用过市面上的多模态AI产品,大概率遇到过这类问题:给它看一张带多个手写公式的图片,它能识别文字却读不懂公式逻辑;和它语音对话时,明明带了开玩笑的语气,它却只会按照字面意思刻板回复。这些问题的根源,恰恰是现有多模态大模型的拼接式架构缺陷。

当前主流多模态大模型普遍采用“语言底座+外挂感知模块”的架构,本质是将视觉、语音信号先转化为符合文本语义空间的嵌入向量,再输入大语言模型处理,相当于AI需要先把非文本信息“翻译”成自己能懂的文字才能处理。

这种架构不仅会丢失大量模态原生信息(比如图像的光影细节、语音的情绪特征),还会大幅提升推理延迟,很多对精度、实时性要求高的场景难以落地,是近两年多模态技术从实验室走向产业端的核心阻碍。

于2026年6月4日正式对外开源的LongCat-Next,核心创新就在于研发团队重构了底层建模逻辑,推出DiNA(离散原生自回归)架构,核心是将图像、语音、文本三类信息统一转化为同源离散Token,所有模态在底座模型中共享同一套参数、注意力机制和损失函数,彻底解决了过去多模态信息只能“被投影”无法“被内化”的问题。

通俗来说,过去文字是AI的唯一母语,视觉、语音都是需要翻译的“外语”,而LongCat-Next实现了三类模态都是AI的原生母语,无需转译即可直接理解处理。此次同时开源的还有配套离散分词器,开发者无需从零搭建模态转换模块,即可直接基于LongCat-Next开发多模态应用。

此前企业开发多模态应用,需要分别适配语音识别、计算机视觉、大语言模型三类不同的技术模块,对接成本高、调试难度大,而原生多模态架构的开源,有望大幅降低产业落地的技术门槛。

据行业测算,基于LongCat-Next开发多模态交互产品,开发周期可缩短40%以上,复杂场景下的多模态理解准确率可提升30%左右,未来在智能座舱、多模态医疗诊断、工业缺陷检测、AIGC内容生成等领域都有广阔的应用空间,甚至可能带动整个大模型行业的技术路线迭代。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。