观点 / 方法精选
Claude Fable 5 网络安全分类器与越狱严重性框架详解
原始标题:More details on Fable 5's cyber safeguards and our jailbreak framework
内容摘要
Anthropic 重新部署 Claude Fable 5 并向全球用户开放,同步披露了内置安全分类器设计。分类器将网络安全使用场景分为四类:禁止使用(勒索软件/物理破坏等)、高风险双重用途、低风险双重用途及良性使用。前两类直接拦截;低风险类别部分监控,仅在安全边际内选择性拦截。此外,Anthropic 与 Glasswing 合作提出 AI 越狱严重性框架初稿,并已启动 HackerOne 项目收集越狱案例。
内容分类AI 观点与方法
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源Anthropic:Newsroom(网页)
站内情报编号intel-cd1bbb67bf25d07aa5693a81