AI圈报
观点 / 方法普通

Anthropic 发布 AI 自我改进研究,Claude 提升对齐能力

信息来源:X:Kim (@kimmonismus)·
原始标题:Anthropic just published one of the clearest previews of recursive self-improvement yet. But we stil…

内容摘要

Anthropic 发布研究论文,让 Claude 负责改进其他 AI 模型的对齐性,包括搜索文献、提出方法、创建训练数据、训练模型并评估迭代。该方法在 60 小时内改善了全部 10 项测试的对齐失败,且未降低通用能力,甚至用较弱的 Sonnet 5 后训练了早期 Opus 4.8 检查点。Anthropic 称最佳 AAR 方法平均在六小时内优于人类专家提出的方案,但尚未实现完全递归自我改进。
内容分类AI 观点与方法
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Kim (@kimmonismus)
站内情报编号intel-b503f31cec2889145c56239b