AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

OpenAI GPT-5.5系统指令泄露 被禁无关联提及哥布林等生物

2026年4月OpenAI旗下Codex CLI代码开源,意外泄露尚未正式发布的下一代大模型GPT-5.5的底层运行规则。据Ars Technica披露,其3500余词的系统提示词中设置罕见禁令:无绝对必要关联时,严禁模型提及哥布林、巨魔等6种特定生物,该禁令重复出现2次,优先级与禁止执行破坏性命令等核心规范持平。

多数用户对大模型的系统提示词认知,还停留在“遵守法律法规”“拒绝有害请求”这类普适性规则上,但本次泄露的GPT-5.5指令集,打破了这种固有印象。

本次泄露的指令集,是OpenAI在开源其代码生成工具Codex CLI的更新版本时,被开发者意外发现嵌入的未公开模型配置文件,随后科技媒体Ars Technica对文件内容做了完整梳理。

这份长达3500多词的基础指令集中,除了常规的安全合规要求外,专门用两处重复的条款强调了特殊限制:除非用户的查询内容和相关生物存在绝对且必要的关联,否则GPT-5.5必须完全回避讨论哥布林、小精灵、浣熊、巨魔、食人魔、鸽子这6种生物。更值得关注的是,这一条款的优先级,和“禁止执行用户提出的破坏性命令”“回复中不得使用表情符号”等核心使用规范完全并列。

截至目前,OpenAI尚未对这一特殊禁令做出官方回应,相关猜测已经在AI开发者社区发酵。有安全工程师推测,这类限制大概率是对齐测试中发现漏洞后的补丁:可能此前的测试版本中,有攻击者利用上述生物的相关设定诱导模型突破安全限制,输出违规内容,因此OpenAI选择直接将相关关键词列入高风险管控范围。

也有网友调侃,这说不定是OpenAI内部团队的“趣味彩蛋”,或者训练数据中上述生物的关联不良内容占比过高,干脆一刀切规避风险。不管最终原因是什么,这种指向具体、看似无厘头的限制条款,已经打破了不少人对大模型规则的固有认知。

事实上,这类看似奇怪的限制,恰恰是大模型安全对齐工作不为人知的细节。此前OpenAI公布的GPT-4对齐报告中就提到,为了避免模型被各种冷门的诱导方式突破限制,技术团队会累计添加上千条针对性的特殊规则,每条规则背后都对应着至少一次安全风险事件。

相比于参数规模、推理速度这些用户可感知的能力提升,这类细碎的对齐优化,才是大模型落地过程中占据大量人力成本的隐形工作。随着大模型能力的不断提升,这类针对性的安全规则可能还会越来越多,未来用户说不定还会发现更多看似反常的模型行为限制,背后其实都是安全团队的前置防护。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。