摘要: 我们解决了在环境动态未知且缺乏合适奖励函数的情况下,安全训练智能体策略并部署良好且安全策略的问题。在安全关键环境中,我们认为传统强化学习不切实际,因此借助人类输入的资源。我们提出了 DROPJ,一种以人为中心的、兼顾安全训练与部署的方法。首先,我们从先前的真实世界轨迹数据集中学习一个世界模型(即学习型模拟器)。然后,人类在这个学习型模拟器中运行游戏,提取若干信息丰富的模拟轨迹。从中,我们采样成对的模拟轨迹片段,并征求人类对这些片段的偏好,以及其选择背后的理由(即正当理由)。接着,我们根据这些带有正当理由的偏好训练一个奖励模型,并利用该模型与世界模型,通过模型预测控制直接部署智能体。通过真实用户实验,我们发现:与其他策略相比,从用户生成信息丰富的模拟轨迹能显著降低训练期间的计算成本,并能在部署期间提升性能。在学习型模拟器中进行训练的背景下,我们证明使用偏好而非其他类型的反馈能大幅提升部署期间的性能。我们进一步表明,伴随偏好提供的安全正当理由能在部署期间显著增强安全性,或优先考虑用户指定的相关安全方面。