摘要
如何验证一个长周期智能体,当它自身的状态和自我报告恰恰是你最无法信任的东西时?我们提出了一种智能体工具,其构建方式使得验证是结构性的,而非事后追溯的。一个确定性的执行器(Executive)拥有全部信念;语言模型只能提交类型化的提案,而一项声明只有在行动前预先注册的预测与代码观察结果匹配时,才被接纳。两个特性使该工具成为其自身科学的验证者,而不仅仅是智能体的验证者:每次运行在逐器官写入错误、渲染大小或加盐金丝雀回显阈值被突破时,都会使自身失效(前八次架构运行中有四次被判定无效,每次均定位到一个真实缺陷);此外,一个渲染不可见的影子参考会编译出完整系统在每个消融单元中本会承诺的计划,因此即使在测试机制已被移除的情况下,漂移指标也能被定义。利用该工具,我们报告了一个关于所有长周期智能体都会遭遇的失败模式的干净、单变量结果:消融承诺机制会使目标放弃率从0.00翻转为1.00,而绑定错误保持平稳在0.00(每个单元三个种子,每次运行最多394个参考节拍,每次运行均通过有效性门控)。相比之下,绑定通道在其修复被消融时,并不会以逐节拍漂移的形式重新出现——因为绑定由代码拥有,失败类别在结构上被吸收,其唯一残余出现在上游一层,表现为假设形成的崩溃。我们在完全披露任务效能为零(在ARC-AGI-3上的52次门控运行中,零层级完成)的前提下报告这些结果,并将其预先注册为结构性失败条件。本贡献在于为智能体开发提供了一种验证方法论,以及它所使之可测量的漂移分解。