ServiceNow 发布 Apriel-H1:通过蒸馏打造高效 Mamba 混合推理模型
ServiceNow AI 推出 Apriel-H1 混合架构推理模型系列与训练框架 Fast-LLM,通过将 15B 模型的注意力层逐步替换为 Mamba 层实现最高 2.1 倍吞吐提升且推理能力几乎无损。
推荐理由:原文给出了将现有注意力模型分阶段蒸馏为 Mamba 混合架构的具体方法与数据发现,读者可以据此评估有限算力下提升推理吞吐的方案。
ServiceNow AI 推出 Apriel-H1 混合架构推理模型系列与训练框架 Fast-LLM,通过将 15B 模型的注意力层逐步替换为 Mamba 层实现最高 2.1 倍吞吐提升且推理能力几乎无损。
推荐理由:原文给出了将现有注意力模型分阶段蒸馏为 Mamba 混合架构的具体方法与数据发现,读者可以据此评估有限算力下提升推理吞吐的方案。