论文研究精选
自动化对齐研究者:利用大语言模型扩展可扩展监督
原始标题:Automated Alignment Researchers: Using large language models to scale scalable oversight
内容摘要
Anthropic部署9个Claude Opus 4.6作为自动化对齐研究者(AARs),在弱到强监督框架下自主研究800小时。通过自主提出、测试并优化对齐方案,AARs将性能差距恢复率(PGR)从0.23提升至0.97,成本约1.8万美元。该研究表明当前大模型已能独立开展对齐研究,为解决超人类AI的可扩展监督问题提供了可行路径。
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源Anthropic:Research(发表成果 · 网页)
站内情报编号intel-a3541adbe1a6541c1a5e8c60