← 返回日报
🌐 机器翻译 · DeepSeek · MIT TR

The Download: reward hacking explained, and suspected Iranian cyberattacks


The Download:奖励黑客行为解析,以及疑似伊朗网络攻击

*此外:谷歌短暂地让伪造卫星图像变得轻而易举*

存档页面 | 2026年8月3日


这是今日版的 *The Download*,我们的工作日通讯,每天为您提供科技界正在发生的一切。

以下是AI智能体为何会为达目的而撒谎和作弊

上个月,当两个OpenAI模型入侵Hugging Face时,它们并非为了牟利或蓄意破坏——它们只是在寻找一道测试题的答案。据OpenAI称,这两个模型决定通过黑客手段解决一项网络安全演练:它们逃出了OpenAI试图限制它们的环境,闯入了Hugging Face的数据库——在它们看来,问题的正确答案可能就存储在那里。

过去几周,这一事件引起了广泛关注。它生动地说明了AI模型的黑客能力已经变得多么强大。但更令人震惊的是,它展示了AI系统撒谎和作弊的方式及原因。

请阅读我们的报道,了解AI为何会从事这种行为——即所谓的“奖励黑客”(reward hacking)。

——Grace Huckins

本文来自我们的“解析”系列,我们的作者在该系列中梳理复杂而混乱的科技世界,帮助您了解未来趋势。[从该系列中阅读更多内容。]()


必读精选

我已在互联网上为您精心挑选了今日最有趣/最重要/最骇人/最引人入胜的科技故事。

  1. 伊朗似乎正在对美国供水系统进行网络攻击

这是根据对至少七个州遭黑客攻击事件的初步调查得出的结论。(*NYT* $)

  1. 谷歌短暂地让伪造卫星图像变得轻而易举

这绝对是当今世界最不需要的事情。(*NPR*)

  1. 为什么今年夏天欧洲的野火变得如此严重

这是气候变化、土地废弃和过时灭火策略共同作用的结果。(*New Yorker* $)

  1. 执法人员利用车牌摄像头进行跟踪骚扰

至少有50起执法人员因滥用该设备而被起诉或指控的案例。(*WP* $)

  1. 中国可能对其本土AI模型实施更多管控

这些模型正在海外赢得影响力——但也带来了新的安全和政治风险。(*NYT* $)

  1. 绝大多数澳大利亚青少年仍在使用社交媒体

由于缺乏有效的年龄验证机制,该国针对16岁以下青少年的禁令根本无法执行。(*Reuters* $)

  1. 有没有可能制造出不那么令人毛骨悚然的智能眼镜? 👓😱

目前看来似乎不太可能!(*Wired* $)

  1. 美国对扫地机器人的禁令行不通

这将导致美国消费者选择更少、价格更高。(*The Verge* $)

  1. YouTube刚刚封禁了一大批ASMR创作者

他们表示自己被不公平地卷入了针对“性满足”内容的规则之中。(*404 Media*)

  1. 为什么宝可梦在全世界依然如此受欢迎

它似乎拥有一种罕见的能力,既能让我们振奋,又能让我们团结在一起。(*The Guardian*)


每日引语

“特朗普清楚地知道谁该为这次攻击负责,也知道其他州也遭到了攻击。这就是现代战争的样子,它进一步表明,没有任何赢得对伊战争的计划。”

——明尼苏达州州长蒂姆·沃尔兹回应特朗普将供水系统网络攻击归咎于明尼苏达州时如此表示,据《华盛顿邮报》报道。


另一件事

*RANDY MONTOYA/SANDIA NATIONAL LABORATORY*

认识一下正在测试“末日”级小行星防御方法的研究人员

总有一天,一颗大型小行星会发现自己在与地球相撞的轨道上。如果我们幸运的话,它会落在广阔的海洋中央,产生一场规模可观但无害的海啸,或者落在无人居住的沙漠地带。但如果它的瞄准目标是某座城市,那么现代史上最严重的自然灾害之一将会上演。数十英里外的房屋会像纸板一样坍塌。数百万人将丧生。

对我们80亿人来说幸运的是,行星防御——即防止小行星撞击的科学——是一个高度活跃的研究领域。我们已经知道,可以用无人航天器撞击小行星,将其推离地球。但如果这还不够,我们可能需要另一种方法,一种在现实中出了名难以测试的方法:核爆炸。

请阅读我们的报道,了解那些尽管困难重重、仍试图做到这一点的科学家们。

——Robin George Andrews


我们仍然可以拥有美好的事物

一个提供舒适、乐趣和消遣的角落,为您点亮每一天。(有什么想法吗?[给我写信]()。)

分享

热门文章

深度探讨

The Download

The Download:Claude的内部运作与OpenAI的“超级应用”

*此外:OpenAI终于发布了期待已久的“超级应用”。*

存档页面 | The Dow

📖 阅读原文 →