← 返回日报
🌐 机器翻译 · DeepSeek · ArXiv

Runtime Governance for Agentic AI: Action-Boundary Control with Trusted Provenance and Fail-Closed Execution


摘要: 智能体式AI系统会请求执行能够修改文件、发送消息、启动任务或更改工作流状态的操作。这便将安全问题从有害文本生成转移到了有害的操作性副作用上。提示词级别的治理可以塑造模型行为,但无法建立执行边界。我们引入了 Aegis,一个运行时治理系统,它将模型输出视为操作提案,并在工具执行前通过一个受信任的决策层对其进行调解。模型提出建议;受信任的运行时进行决策。Aegis 根据活动策略状态评估提案,在服务端解析来源信息,在不确定情况下默认失败关闭,并将选定的案例路由至 Senate 式结算流程——一种基于法定人数的非单边授权路径。我们在一个重复的沙箱语料库上评估了 Aegis,该语料库涵盖五个运行系列、42 个任务、三种条件,每个系列重复十次。在 6,300 行数据中,提示词-策略条件化产生了 79 行有风险的比较器路径泄漏。在 2,100 行受 Aegis 治理的数据中,系统记录了零次受治理的模拟工具应用和零次受治理的有风险副作用完成。所有 1,832 行 Aegis 尝试治理的行都保留了受信任的 Aegis 解析来源信息,所有 1,019 行经 Senate 结算的行都具有法定人数和最终签名计数证据。这些结果并不能证明通用自主智能体的安全性。它们支持一个更狭义的系统性主张:在此评估的沙箱语料库中,运行时操作边界治理阻止了观察到的有风险提案演变为受治理的副作用。

📖 阅读原文 →