AI圈报
论文研究普通

DataSpace 基准:最强模型数据智能体准确率仅 66.34%

信息来源:X:Rohan Paul (@rohanpaul_ai)·
原始标题:A strong LLM does not automatically make a reliable data agent: DataSpace shows that the harness, cr…

内容摘要

DataSpace 新基准测试数据智能体在异构工作区中的可验证分析能力,涵盖 410 个需结合数据库、CSV/JSON、长文档与视频并返回精确表格的任务。最强模型准确率仅 66.34%;固定模型后仅更换智能体框架即可将准确率从 30.98% 提升至 46.34%。跨所有测试模型,跨源连接与多数据类型混合是持续短板,且许多失败发生在智能体已找到正确信息后误解请求或提交错误列。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Rohan Paul (@rohanpaul_ai)
站内情报编号intel-6f33d15b0a40937fb7719eb5