Views
No views yet
| Parameter | Value |
|---|---|
| Base model | Qwen/Qwen2.5-7B-Instruct |
| Method | Supervised Fine-Tuning (SFT) |
| Dataset | ToolAlpaca (4046 train, 68 test) |
| Learning rate | 5e-6 |
| Batch size | 32 (gradient accumulation) |
| Epochs | 1 |
| Seed | 42 |
| DeepSpeed | ZeRO-2 + CPU offload |
| Hardware | L40S 48GB |
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained("Ayushnangia/qwen2.5-7b-instruct-sft-tooluse-lr5e-6-bs32-ep1")
4tokenizer = AutoTokenizer.from_pretrained("Ayushnangia/qwen2.5-7b-instruct-sft-tooluse-lr5e-6-bs32-ep1")