Samples: 50,000
Model: T5-Gemma 2B (google/t5gemma-2b-2b-prefixlm-it)
Format: JSON with teacher logits for knowledge distillation
encoder_input_ids: Long context input tokens (~52k tokens avg)
decoder_input_ids: Output sequence tokens (~296 tokens avg)
reasoning_mask: Mask for reasoning tokens
teacher_token_ids: Teacher model's predicted… See the full description on the dataset page:
https://huggingface.co/datasets/agu18dec/longcode-50k-t5gemma-2b-inference.