PreprintarXiv.org2025
Test-Time Training for Long-Context LLMs
Rachit Bansal, Aston Zhang, Rishabh Tiwari, et al.
Proposes test-time training via targeted gradient updates on context to overcome static self-attention limitations in long-context LLMs, outperforming inference-time scaling.
14Dec 15, 2025Attention MechanismsReasoning
arXiv