AI圈报
产品发布 / 更新精选

PawBench:给通用智能体一把可度量的尺

信息来源:公众号:通义实验室(千问)·

内容摘要

通义实验室推出全新评测基准PawBench v1.0,面向个人助理与通用智能体场景,将底座模型与运行框架Harness纳入同一体系进行交叉评测。评测矩阵包含9个模型与3个Harness(Hermes、OpenClaw、QwenPaw),覆盖150道真实任务共4050个测试单元。结果显示,QwenPaw(76.4分)、OpenClaw(75.4分)、Hermes(70.4分)之间存在显著分差,Harness环境对表现的影响甚至大于模型本身。PawBench还通过切片分析揭示了Harness在产物校验、Skill主动发现和Web搜索默认可用性等方面的关键差距。项目已开源。
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源公众号:通义实验室(千问)
站内情报编号intel-b7040dcc1a8c97f8b707d8da