Preprint2024
Papers Explained 187c: Llama 3.1 — Multimodal Experiments
Unknown
Llama 3.1 adds multimodal capabilities via compositional cross-attention adapters for vision and speech, achieving competitive performance with GPT-4V and strong video reasoning.
0Jul 1, 2024Multimodal