问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
深度求索(DeepSeek)近日正式推出新一代大语言模型DeepSeek V4,该模型在数学推理、代码生成、长文本处理等多个核心基准测试中,成绩超过OpenAI的ChatGPT、谷歌的Gemini以及Anthropic的Claude三款头部主流大模型。业内认为这款大模型刷新了当前开源大模型的性能上限,也给全球通用大模型赛道注入了新的竞争活力。
此次DeepSeek V4对外公布的测试结果覆盖了当前大模型能力评估的核心维度,其中在数学推理基准MATH、代码能力基准HumanEval两项测试中,DeepSeek V4的得分分别达到76.2分和89.1分,不仅超过同定位的ChatGPT 3.5和Gemini 1.5 Flash,也比DeepSeek上一代版本提升了近8个百分点。在128k长度的长文本理解测试中,DeepSeek V4的准确率也比Claude 3 Sonnet高出4个百分点,综合表现已经跻身全球大模型第一梯队行列。
不同于不少大模型研发团队靠堆叠参数提升性能的思路,DeepSeek V4选择了效率优先的技术路线。该模型采用了新一代稀疏注意力机制,在仅120亿激活参数的规模下,实现了接近3000亿参数量闭源模型的通用能力,同时单轮推理成本比同性能级别的头部模型降低了30%以上。
此外,DeepSeek V4原生支持200k上下文窗口,可一次性处理超过15万字的完整长文本,在长文档梳理、多文档总结、全代码库分析等企业高频场景下的体验,明显优于多数同价位竞品。
作为近年来少有的在通用能力上追平甚至反超头部闭源产品的开源大模型,DeepSeek V4的发布打破了“只有头部科技公司能做出顶级通用大模型”的行业惯性认知。此前全球高端通用大模型市场基本被OpenAI、谷歌、Anthropic三家垄断,多数创业公司都选择深耕垂直赛道寻求差异化,DeepSeek的突围证明中小团队聚焦核心技术研发,也能在通用赛场取得突破。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。