MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages Paper • 2607.00890 • Published 28 days ago
Can LLMs Beat Classical Hyperparameter Optimization Algorithms? A Study on autoresearch Paper • 2603.24647 • Published Apr 17
Model-Based Quality Assessment for Massively Multilingual Parallel Data Paper • 2606.00285 • Published May 29 • 1
HPLT 3.0: Very Large-Scale Multilingual Resources for LLM and MT. Mono- and Bi-lingual Data, Multilingual Evaluation, and Pre-Trained Models Paper • 2511.01066 • Published Nov 2, 2025 • 3
Evaluating Self-Supervised Learning in Medical Imaging: A Benchmark for Robustness, Generalizability, and Multi-Domain Impact Paper • 2412.19124 • Published Dec 26, 2024
The Nordic Pile: A 1.2TB Nordic Dataset for Language Modeling Paper • 2303.17183 • Published Mar 30, 2023 • 1