模型发布 / 更新精选
GLM-5.1高速版发布:400 tokens/s,旗舰级能力跑出全球最快API速度
原始标题:GLM-5.1高速版:400 tokens/s,顶尖模型跑出最快速度
内容摘要
智谱面向部分企业客户推出GLM-5.1高速版API"GLM-5.1-highspeed",输出速度达400 tokens/s,刷新全球大模型厂商API速度上限。该版本首次在国产大模型中实现旗舰级能力与极致低延迟并存,由GLM团队与TileRT团队联合打造,通过AOT静态编排、Tile级微任务及8卡NVL拓扑特化等系统级优化,确保400 TPS为稳定可用的生产级能力。