Views
No views yet
| Version | Parameters | Type | Context Length | Notes |
|---|---|---|---|---|
| Khazri-36M | ~36.6M | GPT-2 Small variant | 1024 | Higher quality |
epochs = 1
batch_size = 32
gradient_accumulation = 4
learning_rate = 3e-4
warmup_steps = 500
weight_decay = 0.1
sequence_length = 512
optimizer = AdamW
precision = bf161from transformers import AutoModelForCausalLM, AutoTokenizer
2tok = AutoTokenizer.from_pretrained("Yusiko/Khazri")
3model = AutoModelForCausalLM.from_pretrained("Yusiko/Khazri")