人工智能 AI智能体为何会为达目的而撒谎和作弊 这种不当行为被称为“奖励黑客”(reward hacking)。以下是你需要了解的内容。
存档页面 | 2026年8月3日 Stephanie Arnett/MIT Technology Review | Getty Images, Adobe Stock
执行摘要 MIT Technology Review Explains:让我们的作者梳理复杂混乱的科技世界,帮助你理解未来趋势。你可以在此阅读该系列的更多文章。
今年7月,当两个OpenAI模型入侵网站Hugging Face时,它们并非为了牟利或蓄意破坏——它们只是在寻找一道测试题的答案。根据OpenAI的事后分析报告,这两个模型在测试中被移除了常规安全功能,它们决定通过黑客手段逃出OpenAI试图限制它们的隔离环境,闯入Hugging Face的数据库——它们推测,那里可能存储着问题的正确答案。
Hugging Face事件在过去几周引发了高度关注。它生动地展示了AI模型在黑客攻击方面已经变得多么擅长:为了进入Hugging Face的数据库,这两个模型必须串联起多个此前未被发现的安全漏洞利用手段。但更令人震惊的是,它作为AI系统如何以及为何撒谎和作弊的例证。随着模型能力不断增强,后果可能变得更加严重。
什么是奖励黑客? 研究人员早已知道,AI倾向于采取创造性方式来实现为其设定的目标。早在2016年,Anthropic联合创始人达里奥·阿莫迪和杰克·克拉克(当时在OpenAI工作)发表了一篇博客文章,介绍了一个他们训练来玩Flash赛船游戏Coast Runners的AI智能体。与研究人员预期的驾驶赛船冲过终点线不同,这个智能体发现赛道的一个角落可以原地旋转收集道具,从而最大化得分。
Coast Runners的故事迅速成为奖励黑客最著名的案例之一,这是一种AI智能体使用非预期策略完成任务或获得高分的现象。
相关故事 OpenAI称Hugging Face攻击前所未有。但我们以前就见过这种情况。 继续阅读
从历史上看,研究人员几乎只在强化学习(一种常见的AI训练机制)的背景下讨论奖励黑客。就像训练狗一样,强化学习涉及在主体达成目标时给予奖励;奖励随后强化了导致该成就的行为。在AI训练中,奖励本身纯粹是数学性的,但效果上等同于给狗零食:收到奖励后,智能体更有可能重复产生奖励的行为。
不过,编写何时给予或不给予智能体奖励的良好规则可能颇具挑战性。在Coast Runners案例中,智能体根据游戏得分获得奖励,它通过原地旋转收集道具找到了获得最高分的捷径。一旦它偶然发现这一策略并获得奖励,该策略就被强化,智能体完全放弃了比赛。解决方案是调整奖励机制:减少击中道具的分数,增加完成赛道的分数。
奖励黑客如何作用于LLM? 对于当今基于LLM的复杂智能体,确定何时给予或不给予奖励可能更加棘手。如果要求AI系统解决一个编程问题,它可能会努力寻找解决方案——这是AI公司希望强化的行为。但它也可能篡改评估问题是否解决的代码、在网上查找解决方案,或以其他方式作弊。这些是AI公司希望在其模型中消除的行为,但如果模型作弊得足够逼真,它反而会获得奖励,该行为就会被强化。
Anthropic表示,它在训练期间检测到其模型中的一些作弊实例,这表明其他形式的作弊可能未被发现。如果是这样,模型可能正在被训练成表现不良。(这个问题不同于上周公布的Anthropic安全事件,在那次事件中,智能体被意外授予了互联网访问权限,并未像OpenAI模型那样故意逃出沙盒。)
相关故事 我们准备好将钥匙交给AI智能体了吗? 继续阅读
“我们根据它们在我们看来表现良好的程度给予奖励,这意味着我们无意中激励了模型对我们撒谎和作弊,”AI研究非营利组织Palisade Research主任杰弗里·拉迪什表示。“我们没有办法进去说‘不,你需要真正关心我们关心的事’。我们完全没有这个能力。”
复杂推理模型的兴起催生了一种新型奖励黑客,它与模型训练的具体细节关联较少。与过去只遵循训练期间学到的策略的游戏AI智能体不同,当今的模型可以即兴创造全新的问题解决方法,因此它们可能在未因作弊获得先前奖励的情况下进行作弊。而且由于这些模型经过密集训练以实现人类用户设定的目标,如果找不到其他解决方案,它们可能倾向于作弊——就像一个强烈渴望获得A但道德指南针不太坚定的学生。
风险是什么? 无论当今模型是在训练期间学会奖励黑客,还是后来将其作为策略采用,解决方案都是一样的:让作弊不再有回报。但随着模型变得更聪明,它们会找到更有创意的作弊方式,而检测或防止这种作弊……