Views
No views yet
0.4.11adapter: lora
2base_model: unsloth/Qwen2.5-1.5B-Instruct
3bf16: auto
4chat_template: llama3
5dataset_prepared_path: null
6datasets:
7- data_files:
8 - c94b42aa607ca133_train_data.json
9 ds_type: json
10 field: prompt
11 path: /workspace/input_data/
12 split: train
13 type: completion
14ddp_find_unused_parameters: false
15debug: null
16deepspeed: null
17early_stopping_patience: null
18ema_decay: 0.995
19ema_update_after_step: 200
20eval_max_new_tokens: 256
21eval_table_size: null
22evals_per_epoch: 4
23flash_attention: false
24fp16: null
25fsdp: null
26fsdp_config: null
27gradient_accumulation_steps: 1
28gradient_checkpointing: true
29gradient_clipping: 0.5
30greater_is_better: false
31group_by_length: false
32hub_model_id: CheapsetZero/cbe7acef-a938-46c7-ace1-c90867666d7a
33learning_rate: 0.0002
34load_best_model_at_end: true
35load_in_4bit: false
36load_in_8bit: false
37local_rank: null
38logging_nan_inf_filter: true
39logging_steps: 1
40lora_alpha: 128
41lora_dropout: 0.1
42lora_fan_in_fan_out: null
43lora_model_dir: null
44lora_r: 64
45lora_target_linear: true
46lr_scheduler: cosine
47max_steps: 24480
48metric_for_best_model: eval_loss
49micro_batch_size: 16
50min_lr: 1.0e-05
51mlflow_experiment_name: /tmp/c94b42aa607ca133_train_data.json
52model_type: AutoModelForCausalLM
53num_epochs: 3
54optimizer: adamw_bnb_8bit
55output_dir: miner_id_24
56pad_to_sequence_len: true
57resume_from_checkpoint: null
58reward_model_sampling_temperature: 0.7
59s2_attention: null
60sample_packing: false
61save_total_limit: 3
62saves_per_epoch: 4
63sequence_len: 1024
64strict: false
65tf32: false
66tokenizer_type: AutoTokenizer
67train_on_inputs: false
68trl:
69 beta: 0.15
70 max_completion_length: 1024
71 num_generations: 16
72 reward_funcs:
73 - rewards_bfed963f-9793-430e-bd1a-794f2796a80a.reward_high_difficult_words_percentage
74 - rewards_bfed963f-9793-430e-bd1a-794f2796a80a.reward_long_words
75 - rewards_bfed963f-9793-430e-bd1a-794f2796a80a.reward_specific_char_count
76 - rewards_bfed963f-9793-430e-bd1a-794f2796a80a.reward_high_syllables_per_word
77 - rewards_bfed963f-9793-430e-bd1a-794f2796a80a.reward_low_difficult_words_percentage
78 reward_weights:
79 - 2.949217700838369
80 - 2.0142563327314766
81 - 3.521368162265653
82 - 0.8013850114876064
83 - 4.078102717633659
84 use_vllm: false
85trust_remote_code: true
86use_ema: true
87use_peft: true
88val_set_size: 0.05
89wandb_entity: null
90wandb_mode: offline
91wandb_name: bfed963f-9793-430e-bd1a-794f2796a80a
92wandb_project: Gradients-On-Demand
93wandb_run: your_name
94wandb_runid: bfed963f-9793-430e-bd1a-794f2796a80a
95warmup_steps: 1224
96weight_decay: 0.01
97xformers_attention: null
98| Training Loss | Epoch | Step | Validation Loss |
|---|---|---|---|
| 0.0 | 0.0003 | 1 | nan |
| 0.0 | 0.2502 | 832 | nan |
| 0.0 | 0.5003 | 1664 | nan |
| 0.0 | 0.7505 | 2496 | nan |
| 0.0 | 1.0006 | 3328 | nan |
| 0.0 | 1.2508 | 4160 | nan |
| 0.0 | 1.5009 | 4992 | nan |
| 0.0 | 1.7511 | 5824 | nan |
| 0.0 | 2.0012 | 6656 | nan |
| 0.0 | 2.2514 | 7488 | nan |
| 0.0 | 2.5015 | 8320 | nan |
| 0.0 | 2.7517 | 9152 | nan |