Preprint2021
Doc Former
Unknown
DocFormer introduces an encoder-only transformer with a CNN backbone that fuses visual, textual, and spatial features via a novel multi-modal self-attention layer for document understanding.
0Jun 1, 2021TransformersAttention Mechanisms
arXiv