模型发布 / 更新精选
Hugging Face 发布 LFM2.5 系列 DSpark 草稿模型,推理速度最高提升 3.18 倍
原始标题:Up to 3.2x Faster Inference with LFM2.5-DSpark
内容摘要
Hugging Face 发布 LFM2.5 系列三款模型的 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下,GPU 吞吐最高提升 3.18 倍,端侧最高 2.87 倍。草稿模型约 300M 参数,LFM2.5-2.6B 函数调用延迟平均降低 57%,已开源支持 llama.cpp 和 SGLang。
内容分类AI 模型发布与更新
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源Hugging Face:Blog(RSS)
站内情报编号intel-86d4f0a306e568ce44ab4569