AI圈报
论文研究普通

MerchantBench:评测 LLM 智能体长期经营连贯性

信息来源:X:Rohan Paul (@rohanpaul_ai)·
原始标题:Most agent benchmarks end after one task, but running a store doesn't, and that's where these agents…

内容摘要

MerchantBench 让 LLM 智能体模拟经营网店一整年,涵盖选品、定价与现金流管理,并额外追踪智能体是否持续行动。最佳智能体全年营收仅约为人类水平的四分之一,且常以"沉默"方式达成,提示最终高分可能掩盖数月前就已停止运作的智能体。该基准强调按窗口记录行动频率并观察曲线,以识别长期连贯性缺陷。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Rohan Paul (@rohanpaul_ai)
站内情报编号intel-682909a5d39dddd11cfce17f