AI圈报
论文研究精选

OpenAI 审计 SWE-Bench Pro 发现约 30% 的评测任务存在缺陷

信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例)·
原始标题:Separating signal from noise in coding evaluations

内容摘要

OpenAI 对编码评测基准 SWE-Bench Pro 进行详细审计,发现约 30% 的任务存在缺陷。在 731 个任务的公开子集中,前沿模型通过率在八个月内从 23.3% 提升至 80.3%,但数据质量检查显示大量任务存在测试过于严格、提示词描述不足、测试覆盖不全或误导性提示等问题。OpenAI 建议模型开发者仔细审视评测结果,并指出 AI 智能体在规模化数据质量检查中日益增长的实用性。
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源OpenAI:官网动态(RSS · 排除企业/客户案例)
站内情报编号intel-ba67fdcaf90a5ad20f554be5