Views
No views yet
0.8.0.dev01base_model: deepseek-ai/DeepSeek-R1-Distill-Llama-8B
2lora_model_dir: jrestro/deepseek-r1-nemotron-finetuned
3model_type: LlamaForCausalLM
4tokenizer_type: AutoTokenizer
5tokenizer_path: deepseek-ai/DeepSeek-R1-Distill-Llama-8B
6
7load_in_8bit: true
8adapter: lora
9lora_r: 16
10lora_alpha: 32
11lora_dropout: 0.1
12lora_modules_to_save:
13 - embed_tokens
14 - lm_head
15
16output_dir: ./outputs/nemotron_a40_turbo
17
18datasets:
19 - path: tatsu-lab/alpaca
20 type: alpaca
21 split: train
22 - path: jrestro/nemotron-alpaca-converted
23 type: alpaca
24 split: train
25
26val_set_size: 0.05
27sequence_len: 256
28micro_batch_size: 6
29gradient_accumulation_steps: 1
30learning_rate: 0.0003
31optimizer: adamw_bnb_8bit
32lr_scheduler: cosine
33num_epochs: 1
34warmup_steps: 100
35bf16: true
36gradient_checkpointing: true
37flash_attention: true
38evals_per_epoch: 1
39saves_per_epoch: 2
40logging_steps: 10
41weight_decay: 0.0
42
43ddp: true
44ddp_timeout: 7200
45dataloader_num_workers: 8
46dataloader_pin_memory: true
47| Training Loss | Epoch | Step | Validation Loss |
|---|---|---|---|
| 1.5783 | 1.0 | 4153 | 1.5442 |