AI圈报
产品发布 / 更新普通

FreeToken:单工作站 GPU 运行 753B GLM-5.2 的边缘原生 MoE 推理引擎

信息来源:MarkTechPost(RSS)·
原始标题:Meet FreeToken: An Edge-Native MoE Serving Engine that Runs 753B GLM-5.2 on a Single Workstation GPU

内容摘要

UC Berkeley 与 UT Austin 团队提出 FreeToken,将个人电脑视为统一弹性推理平台,在 8 GB 笔记本 GPU 上以交互速度运行 35B 模型,在单张工作站显卡上运行 753B GLM-5.2。
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源MarkTechPost(RSS)
站内情报编号intel-118ee5a5ecb03346d26dc01f