AI圈报
观点 / 方法普通

EdgeBench 最强智能体 12 小时仅得 51.3 分

信息来源:X:Rohan Paul (@rohanpaul_ai)·
原始标题:Another long-horizon benchmark, another reminder that current AI can work for hours and still remain…

内容摘要

EdgeBench 长时程基准测试中,最强智能体运行 12 小时仅得 51.3/100 分。该基准提供 134 个任务的持久执行环境与反馈,智能体可调试代码、运行模拟并反复提交结果,但 6 类任务约 3.8 万小时交互仍难转化为持续进步。5 个模型的平均表现呈 log-sigmoid 曲线(R2≥0.997),先慢后快再饱和。
内容分类AI 观点与方法
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Rohan Paul (@rohanpaul_ai)
站内情报编号intel-bc56d187195e8c1b9d9cfd7d