AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

Anthropic发布Claude Opus4.8 性能升级使用成本降三分之二

2026年5月29日,AI大模型厂商Anthropic正式发布旗舰级大模型Claude Opus4.8。该版本重点升级智能体编程、复杂逻辑推理与多领域知识处理能力,在SWE-Bench Pro编程基准测试中得分达69.2%,未标注代码缺陷率仅为前代的1/4,综合性能对标OpenAI GPT-5.5的同时,用户单位使用成本下降三分之二。

配图

多位参与内测的独立开发者透露,Claude Opus4.8在处理包含8个以上步骤的复杂任务时,很少出现前代产品常见的逻辑跳步、输出幻觉问题:如果系统判定预设的任务路径存在漏洞,会主动弹出风险提示并给出优化方案,而非直接输出有缺陷的结果。

此前高端通用大模型市场长期处于“性能越高、成本越贵”的状态,OpenAI GPT-5.5、谷歌Gemini Ultra 2等产品的千token定价均超过0.015美元,对于需要高频调用大模型的智能体开发、代码研发企业而言,大模型调用成本占AI项目总投入的比例普遍超过35%,高昂的成本成为高端大模型落地的主要障碍。

本次Claude Opus4.8的升级直接瞄准用户反馈最多的三大痛点:智能体编程可靠性不足、复杂逻辑推理容易跳步、专业领域知识输出准确率低。

官方公布的测试数据显示,新版模型在全球公认的编程基准测试SWE-Bench Pro中拿到了69.2%的高分,是目前公开测试的大模型中排名第一的产品;而开发者最关注的“未标注代码缺陷率”指标直接降至前代产品的25%,也就是说,模型输出有问题的代码却不做任何标注的概率下降了75%,大幅减少了后续人工排查的工作量。

除此之外,新版模型在处理财务建模、法律合规审核、科研文献综述等跨领域复杂任务时,准确率较前代提升了37%,遇到超出知识边界的内容会主动标注不确定性,而非编造信息。

值得注意的是,本次Claude Opus4.8并没有上调定价,而是维持了前代产品的收费标准。对于用户而言,原来需要调用2-3次、配合人工纠错才能完成的复杂任务,现在大多可以一次调用得到合格结果,综合算下来单位使用成本下降了近三分之二,直接拉低了高端大模型的使用门槛。

业内人士分析认为,Anthropic本次发布的新产品直接打破了高端大模型“涨价升级”的惯例,或将倒逼OpenAI、谷歌等竞争对手加快产品迭代速度,同时调整定价策略,未来12个月内高端大模型市场的性价比竞争会进一步加剧,to B端的大模型落地速度也会随之加快。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。