Anthropic发布首款公开Mythos级模型Claude Fable 5 搭载专属安全护栏

2026年6月,以AI安全为核心定位的初创公司Anthropic正式向公众开放旗下首款Mythos级大模型产品Claude Fable 5,这是该公司迄今公开发布的性能最强的大模型,推出时间距其公开警示前沿AI技术滥用风险升高仅数日。该模型针对网络安全、生物科技等高风险领域设置了专属响应拦截护栏,可有效阻挡高危使用请求。

配图

就在今年5月Anthropic联合OpenAI、Google DeepMind等21家全球头部AI企业共同签署AGI研发跨机构安全承诺书后,此次Claude Fable 5的推出,很快被业内视作“安全派”AI厂商平衡前沿性能释放与风险管控的标志性动作。

过去两年间,前沿大模型的能力迭代速度远超行业预期,大量参数规模超万亿的闭源模型仅对付费企业客户开放,普通用户可接触的模型与顶尖性能的差距不断拉大。但另一方面,前沿模型被用于制作恶意软件、合成有害生化物质的案例也屡屡出现,包括Anthropic在内的多家厂商此前都曾明确表示,考虑暂时停止最强模型的公开测试。

就在此次发布的3天前,Anthropic刚刚对外发布了2026年上半年AI风险评估报告,指出当前前沿大模型已经具备了辅助非专业人员完成高风险网络攻击、生化实验设计的能力,全行业的AI安全护栏覆盖率不足40%,风险敞口持续扩大。这份报告发布时,不少业内人士判断Anthropic会放缓顶尖模型的公开节奏,此次Claude Fable 5的上线也因此超出了不少人的预期。

作为Anthropic内部定位最高的Mythos级模型序列的首款公开产品,Claude Fable 5的性能表现较此前主打的Claude 3 Opus有明显提升:公开基准测试数据显示,其在通用知识推理、多模态理解、代码生成等核心场景的平均得分提升了42%,已经追平了此前仅面向头部企业客户开放的内部定制版Mythos模型。

此次产品最大的亮点在于其搭载的分级式安全护栏机制:不同于传统大模型的一刀切内容审核规则,Claude Fable 5将请求划分为普通场景、低风险专业场景、高风险敏感场景三个等级。普通用户的日常使用、专业人员的常规科研/工作请求完全不受审核影响,仅当请求涉及网络攻击方法、有害生物制剂合成、大规模杀伤性武器设计等高风险领域时,系统才会直接拦截响应,并引导有合规需求的用户提交资质证明申请专属授权。据Anthropic公开的数据,该护栏机制的高风险请求漏放率低于0.02%,同时普通请求的响应效率较此前的审核版本提升了61%。

此前全球AI行业的顶尖模型落地普遍走两条路线:要么完全闭源仅服务特定客户,要么完全公开但频繁出现内容安全问题。Anthropic此次的试水被不少分析师看作是第三条路线的可行性验证:顶尖性能的模型同样可以向公众开放,只要配套足够精细的分级管控机制,就能在普惠AI能力的同时控制滥用风险。

Anthropic相关负责人透露,后续Mythos级模型的每一次迭代都会同步推出带安全护栏的公开版本,不会刻意拉大普通用户与企业客户的可使用性能差距。目前已有包括OpenAI、Google DeepMind在内的多家厂商表示,正在测试类似的分级护栏机制,未来可能会跟进推出顶尖模型的公开版本。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。