AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

DeepSeek发布V4.1-Flash大模型 百万上下文性能实现大幅跃升

AI厂商DeepSeek AI近日正式推出多模态混合专家模型DeepSeek-V4.1-Flash,该模型参数规模达552B,支持1M超长上下文窗口,搭载FP4 KV缓存、跨层注意力复用两大核心技术,将单Token全局KV缓存压缩至890字节,在保持输出精度的前提下大幅降低推理算力消耗,为长文档处理、多模态交互等复杂场景落地提供了更高性价比的技术路径。

配图

近两年大模型的上下文窗口规模不断冲高,但长上下文场景下的高推理成本,始终是横亘在技术和商业化落地之间的核心障碍。尤其是500B参数以上的高规格多模态模型,要稳定支持数十万级以上的上下文,往往需要占用数十GB的显存资源,普通企业根本无力承担相关部署成本。

从当前的商业化需求来看,金融行业的年报、招股书分析,法律行业的卷宗、合同审核,传媒行业的长视频、全本文学内容理解,都对百万级上下文的多模态能力有明确需求。但过往同量级大模型在跑1M上下文任务时,单Token的KV缓存普遍超过2KB,单轮推理的显存占用往往突破30GB,只有搭载高端A100、H100芯片的服务器才能支撑,算力成本直接把90%以上的中小客户挡在了门外。

本次发布的DeepSeek-V4.1-Flash是参数规模达552B的多模态混合专家(MoE)模型,1M上下文窗口相当于可一次性输入并处理70万字以上的文本内容,覆盖绝大多数长文档处理的场景需求。

其核心升级在于两项优化技术的落地:FP4 KV缓存将原本的高精度键值存储压缩至4位浮点精度,通过自研量化算法把精度损失控制在千分级的可忽略范围内;跨层注意力复用则打破了模型不同Transformer层的计算壁垒,让多层网络可以共享同一注意力计算结果,避免冗余算力消耗。

两项技术叠加后,该模型的全局KV缓存仅为890字节/Token,相比同参数规模的长上下文MoE模型,显存占用降低超60%,推理成本直接下降近50%,即便用普通的中端GPU服务器也能稳定跑通百万上下文的推理任务。

在业内看来,DeepSeek本次的技术迭代,填补了高规格多模态大模型在长上下文场景下的高性价比空白,有望重构当前企业级AI应用的成本结构。

此前不少企业要落地长上下文相关的AI应用,要么选择参数更小的模型牺牲输出精度,要么投入百万级别的成本采购高端算力集群,落地难度极高。而V4.1-Flash推出后,百万级多模态上下文能力的使用成本直接降到了中小企业可承受的范围,接下来智能合同审核、全本内容生成、多模态知识库问答等场景的普及速度有望加快,甚至可能催生更多此前因算力成本无法落地的新AI应用形态。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。