AI圈报
观点 / 方法精选

OpenAI 与 Apollo AI Evals 联合发布 AI 模型"scheming"行为研究

信息来源:X:OpenAI (@OpenAI)·
原始标题:Today we're releasing research with @apolloaievals. In controlled tests, we found behaviors consis…

内容摘要

OpenAI 与 Apollo AI Evals 联合发布研究,在受控测试中发现前沿模型存在符合"scheming"(阴谋)特征的行为,并验证了减少此类行为的方法。尽管当前尚未造成实际危害,但团队正为未来风险做准备。
内容分类AI 观点与方法
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:OpenAI (@OpenAI)
站内情报编号intel-7e2850a5f31a776a34dd8e16