Views
No views yet
google/flan-t5-small student trained on openai/gsm8k with a local Generalized Knowledge Distillation (GKD) setup based on the paper On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes.google/flan-t5-smallgoogle/flan-t5-largeopenai/gsm8k77M parametersjsd0.50.53e-41161640005123201920.05| Model | Accuracy |
|---|---|
| FLAN T5 Small | 0.0227 |
| FLAN T5 Base | 0.0318 |
| FLAN T5 Large | 0.0538 |
| Trained Student | 0.0243 |
flan-t5-small baseline, but remains well below the large teacher.1from transformers import AutoTokenizer, AutoModelForSeq2SeqLM
2
3repo_id = "Pradheep1647/flan-t5-small-gsm8k-77m-gkd-jsd-lr3e4-b16-u4k-lam05-beta05"
4tokenizer = AutoTokenizer.from_pretrained(repo_id)
5model = AutoModelForSeq2SeqLM.from_pretrained(repo_id)
6
7prompt = "question: Janet’s ducks lay 16 eggs per day. She eats three for breakfast every morning. How many eggs does she sell?\nanswer:"
8inputs = tokenizer(prompt, return_tensors="pt")
9outputs = model.generate(**inputs, max_new_tokens=128)
10print(tokenizer.decode(outputs[0], skip_special_tokens=True))flan-t5-small student at this scale.