观点 / 方法精选
GPT-5.5幻觉率达86%,GLM-5.2仅28%--大模型越大越不可靠
原始标题:GPT-5.5的幻觉生成率是采用MIT许可证的GLM-5.2的3倍
内容摘要
GLM-5.2(MIT开源,753B参数,约40B活跃)在AA Intelligence Index上仅比GPT-5.5低4分、比Claude Fable 5低9分,但其幻觉率仅28%,远低于GPT-5.5的86%和DeepSeek V4 Pro(1.6T参数,49B活跃)的94%。后者在AA-Omniscience基准上仅6%的问题会承认不知道。实际代码测试中,GLM-5.2用12秒和800个推理token识别出技术悖论,而DeepSeek V4 Pro耗费3分26秒和近10倍推理token后仍给出错误答案。模型规模增长正导致幻觉率飙升而非智力提升。
内容分类AI 观点与方法
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源Hacker News 热门(buzzing.cc 中文翻译)
站内情报编号intel-03b0effb452d5d940689e4c7