sft-dataset — 57K SFT Post-Training Dataset (for small LLMs)
A combined supervised fine-tuning dataset designed for a ~50M parameter language model.
All examples are English, in OpenAI-style messages conversation format,
capped at ~1,000 estimated tokens per example (fits a 2K context window).