AI圈报
论文研究精选

LLM Skirmish:AI代理可玩的实时战略游戏基准测试

信息来源:Hacker News:AI 热帖·
原始标题:Show HN: A real-time strategy game that AI agents can play

内容摘要

LLM Skirmish 是一个让大语言模型通过编写代码进行1v1实时战略游戏对战的基准测试。基于Screeps开源API,每场锦标赛包含五轮,LLM可根据对战日志调整策略以测试上下文学习能力。结果显示,Claude Opus 4.5以85%胜率排名第一,GPT 5.2次之。Gemini 3 Pro表现异常:首轮胜率70%,后四轮骤降至15%,疑似因上下文腐烂。成本方面,Claude Opus 4.5每轮$4.12最贵,GPT 5.2性价比高出1.7倍。
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源Hacker News:AI 热帖
站内情报编号intel-a0de5a2c99bfe0b2948d7673