A comprehensive multi-domain training dataset with 619,177 samples covering code generation, mathematical reasoning, conversational AI, commonsense reasoning, and financial QA.
Multi-Domain Coverage: 5 major domains with diverse tasks
Pre-Merged Files: Ready-to-use merged files for each domain
Unified Format: Consistent conversational structure across all datasets
High Quality: Curated from well-known open-source datasets
Flexible… See the full description on the dataset page:
https://huggingface.co/datasets/togethercomputer/aurora.