跳到正文
原文
Hugging Face·· 2021-03-31AI 评分50

解析 BigBird 的块稀疏注意力机制

Understanding BigBird's Block Sparse Attention

AI 导读

BigBird 类 RoBERTa 模型已集成至 Hugging Face Transformers,通过块稀疏注意力将支持的序列长度拓展至 4096。该机制结合了滑动注意力、全局 token 与随机 token 来近似 BERT 的全注意力矩阵,在保留长距离依赖的同时大幅降低计算复杂度。模型已在长文档摘要和长上下文问答等多项长序列任务上达到 SOTA。

来源:Hugging Face · huggingface.co