Views
No views yet
| Param | Value |
|---|---|
| LoRA rank / alpha | 32 / 64 |
| Learning rate | 6e-4, cosine schedule, warmup ratio 0.05 |
| Epochs | 1 |
| Effective batch size | 128 |
| Max sequence length | 8192 |
| Seed | 42 |
1from peft import PeftModel
2from transformers import AutoModelForCausalLM, AutoTokenizer
3
4base = AutoModelForCausalLM.from_pretrained("meta-llama/Llama-3.1-8B", torch_dtype="bfloat16")
5model = PeftModel.from_pretrained(base, "hcasademunt/llama-3.1-8b_qwen3.5-9b_unfiltered_seed42")
6tok = AutoTokenizer.from_pretrained("hcasademunt/llama-3.1-8b_qwen3.5-9b_unfiltered_seed42") # correct chat template