AI圈报
模型发布 / 更新精选

OpenAI 发布 GPT-5.6 系列医疗评估结果

信息来源:X:Sam Altman (@sama)·
原始标题:"physicians found fewer flaws in GPT-5.6 responses than physician-written responses."

内容摘要

OpenAI 发布 GPT-5.6 系列在医疗领域的评估结果。最小变体 GPT-5.6 Luna 在最低推理强度下即超越最高推理强度的 GPT-5.5,且成本低 25 倍;最大变体 GPT-5.6 Sol 树立新标杆。在涵盖患者端与临床端的多样化任务中,专科医生被要求以无限时间和网络访问权限撰写回答,随后由其他医生盲评。评估基于准确性、沟通、完整性、指令遵循及健康决策帮助性五个维度,共 20000 次评分。结果显示,所有 GPT-5.6 模型表现均显著优于医生,且医生发现 GPT-5.6 回答中的缺陷少于医生自己撰写的回答。
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Sam Altman (@sama)
站内情报编号intel-515a835d7f688ef6b7917685