Bienvenue sur le dépôt officiel du Lauma Dataset. Ce jeu de données massif de 51.6 Go est une mine d'or hautement optimisée pour le pré-entraînement, le raffinement (Fine-Tuning) et l'alignement de modèles de langage (LLMs) francophones et hybrides.
Il regroupe un mélange massif de textes scientifiques, de code source, de chaînes de raisonnement profond (Reasoning/Thinking), de dialogues avancés et de culture générale.
🛠️ Spécifications… See the full description on the dataset page: https://huggingface.co/datasets/Weoxx62/lauma-dataset.