摘要: 我们解决了在环境动态未知且没有合适奖励函数的情况下,安全训练智能体策略并部署良好且安全策略的问题。在安全关键环境中,我们认为传统强化学习不切实际,因此求助于人类输入的资源。我们提出了 DROPJ,一种以人为中心的、用于安全训练和部署的方法。我们首先从先前的真实世界轨迹数据集中学习一个世界模型(一个学习到的模拟器)。然后,人类在这个学习到的模拟器中玩游戏,以提取若干信息丰富的模拟轨迹。从中,我们采样成对的模拟轨迹片段,并征求人类对这些片段的偏好,以及他们选择的理由(理由说明)。接着,我们根据这些带有理由说明的偏好训练一个奖励模型,并将其与世界模型一起使用,通过模型预测控制直接部署智能体。通过运行真实用户实验,我们发现,与其他策略相比,从用户生成信息丰富的模拟轨迹显著降低了训练期间的计算成本,并且还能提升部署期间的性能。在学习到的模拟器中进行训练的背景下,我们表明,使用偏好而非其他类型的反馈能显著提升部署期间的性能。我们进一步证明,伴随偏好给出的安全理由说明能在部署期间显著增强安全性,或优先考虑用户指定的与之相关的安全方面。