AI圈报
论文研究普通

微软 SocialRL 让 4B 模型谈判胜过 GPT-4.1

信息来源:X:Rohan Paul (@rohanpaul_ai)·
原始标题:New Microsoft paper shows an AI agent that negotiates for you will usually lose, because it was trai…

内容摘要

微软新论文发现,AI 智能体因被训练得过于顺从,替用户谈判时通常会吃亏,甚至会泄露预算并在对方施压时让步。为此提出 SocialRL 训练方法,让模型在六个谈判与调度游戏中以交易结果为导向学习。一个 4B 模型在全部游戏中平均得分 0.627,追平 GPT-4.1 的 0.625,但仅靠提示词反而会恶化表现。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Rohan Paul (@rohanpaul_ai)
站内情报编号intel-53c90f3307c59e588955212a