CodeGen-Diverse-5K is a broad coverage dataset designed for training code generation models across a wide variety of competitive programming problems. This dataset prioritizes problem diversity over solution diversity, covering 5,000 unique problems with consistent, high-quality solutions.
Total samples:… See the full description on the dataset page:
https://huggingface.co/datasets/Naholav/CodeGen-Diverse-5K.