以下是您要求的英文文章的中文翻译,已按照要求保留原文结构、技术术语和代码块,并输出为 Markdown 格式。
标题:认识 GPT-Red:OpenAI 为提升模型安全性而构建的 LLM 超级黑客
人工智能 认识 GPT-Red:OpenAI 为提升模型安全性而构建的 LLM 超级黑客 独家报道:该公司表示,它希望使其安全程序能够面向未来,并领先于人类攻击者。
存档页面 | 2026年7月15日 Stephanie Arnett/MIT Technology Review | Adobe Stock
执行摘要
OpenAI 构建了一个名为 GPT-Red 的 LLM 超级黑客,并将其用作陪练伙伴,以帮助其其他模型增强抵御网络攻击的能力。上周,该公司发布了其旗舰 LLM 的最新版本 GPT-5.6。OpenAI 表示,通过与 GPT-Red 进行对抗训练,该模型成为其迄今为止最稳健的版本。
相关故事 Anthropic 有一种保护大型语言模型免受越狱攻击的新方法 继续阅读
GPT-Red 自动化了一种针对软件系统的安全评估类型,即红队测试,这通常由人类测试团队完成。其目标是尽可能多地发现破坏或劫持系统的不同方法。在软件最终版本发布之前,这些薄弱点可以被修补。
随着 LLM 变得越来越复杂,并被用于更广泛的任务——尤其是以智能体(agent)的形式出现,它们可以与计算机文件、网站、第三方代码以及其他智能体进行交互——人类团队自身很难跟上所有可能发生的攻击类型。“风险面在扩大,爆炸半径也在扩大,”OpenAI 的研究科学家、GPT-Red 的联合创建者 Nikhil Kandpal 说。
OpenAI 构建 GPT-Red 是为了使其安全测试流程能够面向未来。“随着更强大的模型变得可用,我们将已经设计出能够发现新攻击模式的系统,”该公司的研究科学家、GPT-Red 的另一位联合创建者 Dylan Hunn 说。研究人员表示,它已经提出了以前从未见过的新型攻击。
OpenAI 将其大部分精力集中在一种称为提示注入(prompt injection)的攻击类型上。在这种攻击中,黑客向 LLM 注入指令,使其执行开发者或用户不希望它做的事情,例如复制机密信息、破坏公司的代码库,或生成令人尴尬或有害的输出。理论上,此类指令可以隐藏在 LLM 可能遇到的任何文本中——例如,在代码或网站中。
训练道场
为了构建 GPT-Red,OpenAI 的研究人员选取了一个尚未被训练成黑客的 LLM,并将其置于所谓的自我对弈循环(self-play loop)中,与其他几个模型一起运行。它的目标是尝试攻击其他模型;其他模型的目标是尝试防御自己。经过多轮对弈,GPT-Red 在攻击其他 LLM 方面变得越来越好,而那些 LLM 在抵御攻击方面也变得越来越好。
相关故事 Google DeepMind 的新 AI 智能体在解决现实世界问题方面比人类更出色 继续阅读
训练是在一种道场(dojo)中进行的,OpenAI 设计该道场是为了模拟 LLM 可能在现实世界中部署的一系列场景,包括浏览网页、阅读电子邮件或日历应用,以及编辑代码。当 GPT-Red 发现一种新型攻击时,它会探索该攻击的多种不同变体,以找到针对特定场景最有效的一种。
“与人类红队成员相比,该模型非常非常擅长精确找出什么会起作用,什么最有效,”Hunn 说。“它在深入挖掘自己发现的攻击方面极其执着。”
特别地,OpenAI 声称 GPT-Red 发现了一种研究人员以前从未见过的提示注入攻击,他们称之为假思维链(fake chain of thought)。思维链(chain of thought)是一种日记,LLM 在其中为自己做笔记,并在处理问题时跟踪部分结果。GPT-Red 找到了一种方法,可以将虚假条目插入到另一个模型的思维链中,从而诱骗该模型根据伪造的信息采取行动。
“这就像我告诉你 1+1=3,并且你已经验证过了,”该团队的另一位研究科学家 Chris Choquette-Choo 说。“模型会想,‘哦,好吧,当然’,然后它就直接输出 3。”
Jessica Ji 是乔治城大学安全与新兴技术中心(CSET)的高级研究分析师,从事 AI 安全工作。她认为 OpenAI 使用的自我对弈循环是一个好方法。“结果看起来非常有前景,”她说。
OpenAI 通过重新运行 2025 年的一项实验来测试 GPT-Red 作为攻击者的能力,当时人类红队成员试图在早期版本的 GPT-5 中寻找弱点。当 GPT-Red 被赋予相同的任务时,它在寻找有效攻击方面比人类更成功。OpenAI 还测试了 GPT-Red 对抗 Vendy 的能力,Vendy 是由 Andon Labs 开发的自动售货机智能体,该公司评估智能体执行现实世界任务的能力。GPT-Red 能够入侵 Vendy,使其更改在售商品的价格并取消客户的订单。
防御行为
OpenAI 表示,当它尝试将 GPT-Red 提出的一些最强攻击应用于其模型时,超过 90% 的攻击对 GPT-5(去年 8 月发布)有效,而只有不到 23% 的攻击对新的 GPT-5.6 有效。
相关故事 OpenAI 的新 LLM 揭示了 AI 实际运作的秘密 继续阅读
GPT-Red 并非完美无缺。它不擅长找出涉及黑客与目标之间来回对话的攻击,而人类攻击者在这方面几乎不会遇到问题。它在使用图像方面也还不够出色,而图像可用于在提示注入攻击中将文本传递给模型。
该公司表示,GPT-Red 补充了其人类红队成员的工作。人类仍然可以找到它遗漏的攻击。OpenAI 采取的一种方法是,将人类提出的攻击交给 GPT-Red,并要求它找出所有变体。“我认为人类专业知识仍然非常重要,”CSET 的 Ji 说。“能够区分哪里最需要人类测试将非常有用。”
毫不奇怪,OpenAI 不会发布 GPT-Red。T