论文研究精选
OpenAI 用 AI 攻击自家 AI:GPT-Red 自动发现安全漏洞,成功率 84% 远超人类
原始标题:OpenAI is now using AI to attack its own AI, and it's working better than humans ever did
内容摘要
OpenAI 训练了内部 AI 模型 GPT-Red,通过自我对弈强化学习自动模拟提示词注入等攻击,在测试场景中成功率达 84%,而人类红队仅为 13%。GPT-Red 的发现直接用于训练,使 GPT-5.6 Sol 在直接提示词注入上的故障次数比四个月前的最佳模型减少六倍,且未影响通用性能。约 3.8% 的"更强"提示词注入仍能成功,GPT-Red 暂不对外开放。
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源The Decoder:AI News(RSS)
站内情报编号intel-d573c9291b901983599b45bb