AI圈报
论文研究普通

自主智能体安全无法跨迭代组合

信息来源:X:Rohan Paul (@rohanpaul_ai)·
原始标题:If an autonomous agent remembers across iterations, its safety system cannot afford to forget betwee…

内容摘要

新论文《Safety Does Not Compose》指出,自主智能体若跨迭代记忆,其安全系统就不能在迭代间遗忘,长期任务安全无法简化为重复运行安全的短期轨迹。攻击者可将恶意证据分散在多个看似良性的步骤中,仅基于轨迹的监控器无法积累足够上下文识别攻击。论文地址:arxiv.org/abs/2608.27141。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Rohan Paul (@rohanpaul_ai)
站内情报编号intel-331014a27fc4f62020caf259