想让AI学会安全驾驶?别只给奖励,还要让它听得懂批评
传统的强化学习靠奖励函数驱动,但现实中很多危险行为恰恰因为奖励设计不完善而被“鼓励”出来。这篇论文提出了一种全新的训练范式:通过世界模型结合人类偏好和具体理由,教会智能体什么该做、什么不该做。关键在于,人类不仅给出“好”或“坏”的评分,还会附带一句解释——“因为你差点撞到行人”。智能体通过世界模型模拟这一场景的因果链,真正理解为什么某个动作是危险的。这种方法让AI在未知环境中也能泛化出安全行为,不再需要人工穷举所有危险场景。对于自动驾驶、医疗机器人等高危领域,这可能是从“黑箱奖励”走向“可解释安全训练”的转折点。
Learning Safe Agent Behaviour from Human Preferences and Justifications via World Models
We address the problem of safely training an agent policy and deploying a good and safe policy, in settings where the environment dynamics are unknown