跳到正文
原文
Hugging Face·· 2026-06-11AI 评分47

PyTorch 性能分析(第二部分):从 nn.Linear 到融合 MLP

Profiling in PyTorch (Part 2): From nn.Linear to a Fused MLP

AI 导读

Hugging Face 深入分析了 PyTorch 中从 nn.Linear 到 MLP 模块的底层 GPU 执行机制。测试表明,nn.Linear 借助 GEMM epilogue 将偏置加法融入 cuBLAS 内核,权重转置仅在 CPU 上修改元数据。由于 eager 模式已默认调用 aten::addmm,torch.compile 对单个线性层几乎没有额外融合空间。

来源:Hugging Face · huggingface.co