问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
AI大模型厂商DeepSeek于2026年8月14日宣布,最新迭代的DeepSeek-V4-Pro-0813大模型在硅基流动(SiliconFlow)平台实现Day-0首发。该模型支持1M超长上下文窗口,搭配低/高/最大三档可调推理强度,主打编码、工具调用与智能体工作流场景,沿用MIT开源协议,定价为输入每百万token 1.32美元、输出3.96美元,缓存命中仅0.44美元。

对长期深耕智能体开发的团队而言,长上下文推理的成本始终是悬在头顶的达摩克利斯之剑:一次涉及十万级token企业知识库的调用,反复跑几次就能烧掉小团队一周的算力预算。而DeepSeek本次上线的新模型,直接把最影响这类场景成本的缓存价格打了下来。
最近一年来,大模型的上下文窗口长度从128K快速跃升至1M乃至更高,长文档解析、全量代码库调试、企业级智能体等场景的可行性大幅提升,但对应的推理成本却没有同步下降。
尤其是对于需要反复调用同一段长文本输入的智能体工作流来说,重复计算相同的上下文内容相当于反复支付相同的算力费用,不少中小团队的测试阶段算力成本就已经超过10万元,直接阻碍了产品的规模化落地。
本次上线的DeepSeek-V4-Pro-0813核心参数恰好对准了上述痛点,1M(百万token级)上下文窗口可以一次性载入超过70万字的文本内容,足以覆盖绝大多数企业级长文档、中大型代码库的处理需求。搭配的低/高/最大三档可调推理强度,则允许开发者根据场景灵活选择配置:简单的信息抽取、格式转换任务可选择低档控制成本,复杂的逻辑推理、多工具调用场景可切换到最高档保障效果。
定价方面最具冲击力的是缓存政策:常规输入每百万token定价1.32美元、输出3.96美元,而缓存命中的token每百万仅需0.44美元,相比常规输入成本下降了近67%。对智能体场景而言,这意味着只要首次载入的上下文内容命中缓存,后续所有调用都仅需支付三分之一的成本,部分高频调用场景的整体算力成本可直接下降50%以上。
该模型依旧采用MIT开源协议,个人及商业用户均可自由使用,无额外授权限制。此外同系列还推出了定位高吞吐量低延迟的DeepSeek-V4-Flash-0731,和Pro版形成场景互补,覆盖实时对话、批量内容生成等需求。
此次DeepSeek V4 Pro选择在硅基流动平台实现Day-0首发,也反映出当前大模型产业的协作趋势:大模型厂商和算力服务平台的前置适配已经成为常态,新模型发布即可面向全行业开发者开放使用,无需等待漫长的适配周期。
而缓存定价的推出更是为行业树立了新的成本锚点,过去行业普遍将注意力放在常规输入输出的定价上,本次针对高频复用场景的缓存降价,意味着大模型的成本竞争已经从“粗犷降价”转向“精细化场景定价”,后续预计会有更多厂商跟进类似的差异化定价策略,进一步降低AI应用的落地门槛。
本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。