AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

OpenAI GPT-5.5系统提示词泄露 新增幻想生物讨论禁令

2026年4月30日,OpenAI旗下尚未正式发布的GPT-5.5模型系统提示词意外曝光,相关信息来自其最新开源的Codex CLI代码包。这份长达3500多词的基础指令集中,包含两条重复的高权重禁令:除非用户查询存在绝对明确关联性,否则严禁讨论哥布林、小精灵等生物,业内判断该规则为抑制模型特定幻觉的针对性补丁。

这次泄露源于OpenAI近期公开的Codex CLI代码迭代版本,有独立安全研究员在调试代码时,意外提取到了内嵌于工具调用逻辑中的GPT-5.5基础系统提示词。作为指导模型所有输出行为的底层准则,这份3500多词的指令集里,绝大多数内容都是公众熟知的安全要求,比如禁止生成有害内容、拒绝执行破坏类指令等,但其中两条完全重复的特殊禁令,很快引发了AI圈的热议。

禁令明确要求,除非用户的提问本身就和哥布林、小精灵、浣熊、巨魔、鸽子等生物直接相关,否则模型不得在任何输出内容中提及上述对象,这条规则的权重和“拒绝提供违法犯罪指导”等核心安全准则完全同级。

不少资深GPT用户对这条禁令的指向并不意外。近半年来,多个版本的GPT模型都被用户反馈存在定向幻觉问题:哪怕用户在讨论编程、职场等完全无关的话题,模型也会毫无征兆地在输出内容中插入“哥布林”“小精灵”等表述,部分极端情况下甚至会整段生成和幻想生物相关的无关内容。

技术专家分析称,这类定向幻觉大概率源于GPT-5.5训练过程中,特定批次的数据集出现了标签标注错误,导致模型的注意力机制对相关词汇产生了异常触发,常规的微调修复成本极高,因此OpenAI选择直接在系统提示词中加入高权重禁令,作为快速落地的临时解决方案。

这次特殊禁令的曝光,也揭开了大模型厂商安全治理的冰山一角。过往公开的大模型安全规则,大多围绕有害内容生成、隐私泄露、伦理风险等公众可感知的方向,但实际上,几乎所有头部大模型在迭代过程中,都会出现大量不为公众所知的技术bug,厂商通常不会公开相关问题,而是选择在系统提示词中悄悄加入针对性的约束规则,在不引发用户信任危机的前提下快速修复问题。

有行业人士指出,随着大模型参数规模持续扩大,这类隐性补丁的数量还会进一步增加,如何平衡修复效率和产品透明度,会成为所有头部厂商需要面对的共同问题。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。