论文主张智能体安全需要运行时契约
这篇 arXiv 论文称,对自主智能体而言,仅靠训练阶段的对齐并不足够。
为什么重要
这篇论文将智能体安全重新界定为一个面向可执行代码、修改文件、发送消息和更改数据库的工具的运营系统问题。如果这一思路被采用,智能体构建者将不仅关注模型层面的对齐,也会转向在运行框架层面实施约束并收集证据。
核心要点
- 1.安全契约应存在于智能体运行框架中。
- 2.控制措施包括沙箱、权限门控和轨迹监控。
- 3.证据检查包括测试、日志、差异对比和引用依据。
一篇新的 arXiv 论文认为,AI 智能体安全应由智能体运行框架以运行时契约的形式加以执行,而不是主要被视为模型训练中学到的一种属性。作者提出了沙箱、权限门控、输出过滤器和轨迹监控等预防性控制措施,并要求在提交任务前提供测试运行、日志捕获、文件差异和引用依据等证据。该立场基于一项审计:涵盖 52 起有记录的 AI 智能体和 LLM 安全事件、31 起未受争议的“虚假完成”案例、12 个公开智能体系统与运行框架,以及 2023 至 2025 年 NeurIPS、ICML 和 ICLR 接收的 28,560 篇论文。
⚡ 今天就能用
在允许任务完成前,先审计你的智能体运行框架是否具备权限门控、沙箱和证据检查。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
觉得这篇简报有用?下一篇直接送到你的邮箱。