Hugging Face·· 2 天前AI 评分40
Olmo-core 3 发布:面向大型 MoE 的开源可扩展训练基础设施
Introducing Olmo-core 3: Open, scalable training infrastructure for large MoEs
AI 导读
开源大语言模型训练框架 Olmo-core 3 发布,采用重新设计的 MoE 训练系统,支持将模型扩展至万亿参数规模。新架构改用 DDP 并支持 MXFP8,在 8 块 NVIDIA B300 GPU 上测试 47B MoE 的吞吐提升约 2.7 倍至 52,000 tokens/s/GPU。在 512 块 B300 集群上,其 1.2 万亿参数模型最高吞吐达到 858 TFLOP/s/GPU。
来源:Hugging Face · huggingface.co