摘要
具身智能体是一种通过物理实体与环境交互的智能实体。当前,对具身智能体的评估主要依赖两种范式:(1)人工标注的视觉问答(VQA)对;(2)高层级任务完成度指标,例如导航或操作的成功率。前者劳动密集且标注质量参差不齐。后者可能掩盖关键缺陷,允许智能体通过次优手段或违反安全规则的方式完成任务,从而隐藏安全风险和低效问题。鉴于空间认知是执行具身任务的基石,我们迫切需要评估具身智能体在任务执行过程中是否具备稳健的空间认知能力。受软件工程中蜕变测试原理的启发,我们提出了 MetaSpace,一个旨在评估智能体空间认知能力的新型框架。通过利用从真实执行轨迹中提取的时空多模态状态,MetaSpace 基于预定义的、根植于逻辑规则和物理规律的蜕变关系(MRs)自动生成测试用例。关键在于,我们将这些蜕变关系编码为逻辑编程语言(Prolog)中的可执行规则。违反这些关系即表明空间认知存在缺陷。我们在三个具身场景中的实证评估表明,MetaSpace 成功检测出最先进(SOTA)多模态大语言模型(MLLM)驱动智能体中的 90,422 个空间认知错误。我们引入了空间认知(SC)分数来量化性能。结果表明,所有 SOTA 智能体的平均得分在 0.44 到 0.52 之间,显著低于人类基准的 0.96。