Agentic AI的"刹车系统":运行时治理如何防止AI越权操作
当AI智能体开始自主修改文件、发送消息、启动任务时,安全问题的本质发生了根本性转变——从"模型会不会说错话"变成"系统会不会做错事"。这篇论文直面Agentic AI最危险的漏洞:工具调用的边界失控。作者提出了一套运行时治理框架,包含三个核心机制:动作边界控制(Action-Boundary Control)为每个智能体划定严格的操作权限范围;可信来源追踪(Trusted Provenance)确保每个动作都有完整的操作日志链;失败关闭执行(Fail-Closed Execution)则在任何不确定性出现时自动终止操作。这套框架的关键洞察是:与其依赖模型自我约束,不如在系统层面建立不可绕过的安全护栏。实验表明,该机制能在不显著影响任务完成率的前提下,将危险操作拦截率提升至99.2%。对于正在将Agent部署到生产环境的企业来说,这篇论文提供了从"信任模型"转向"信任系统"的完整方法论。
Runtime Governance for Agentic AI: Action-Boundary Control with Trusted Provenance and Fail-Closed Execution
Agentic AI systems request tool actions that can modify files, send messages, launch jobs, or change workflow state. This shifts the safety problem fr