Preprint2024
Shiksha
Unknown
Creates a 2.8M-pair multilingual parallel corpus for scientific/technical MT in eight low-resource Indian languages from NPTEL lecture transcriptions.
0Dec 1, 2024
A comprehensive index of artificial intelligence and machine-learning research with AI-generated summaries, citation metrics, and direct links to papers and code.
Unknown
Creates a 2.8M-pair multilingual parallel corpus for scientific/technical MT in eight low-resource Indian languages from NPTEL lecture transcriptions.
Unknown
Dolma is an open corpus of three trillion tokens for language model pretraining, designed to support transparency and reproducibility in AI research.
Unknown
Galactica is a large language model trained on a massive scientific corpus, achieving state-of-the-art results on scientific tasks and introducing a working memory token for multi-step reasoning.