论文研究普通
FreeToken 引擎让 8GB 游戏本跑 35B 模型
原始标题:An 8 GB gaming laptop can run a 35B model at 39.3 tokens a second, faster than Codex in production, …
内容摘要
伯克利和得克萨斯大学推出 FreeToken,新引擎可在普通设备上运行大型开源模型。8GB 游戏本跑 35B 模型达 39.3 tokens/秒,快于生产环境中的 Codex。FreeToken 让 GPU 缓存跟随路由请求,将专家缺失率从 llama.cpp 的 62% 降至 16%,其余按 PCIe 和内存速度比例分配。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Rohan Paul (@rohanpaul_ai)
站内情报编号intel-aa938ffd60afc535601d576b