Views
No views yet
0.4.11adam_beta1: 0.9
2adam_beta2: 0.999
3adam_epsilon: 1.0e-08
4adapter: lora
5base_model: EleutherAI/pythia-410m-deduped
6bf16: true
7chat_template: llama3
8dataloader_num_workers: 4
9dataloader_pin_memory: true
10dataset_prepared_path: null
11datasets:
12- data_files:
13 - f483f621ec4ec954_train_data.json
14 ds_type: json
15 format: custom
16 path: /workspace/input_data/
17 type:
18 field_instruction: instruct
19 field_output: output
20 format: '{instruction}'
21 no_input_format: '{instruction}'
22 system_format: '{system}'
23 system_prompt: ''
24debug: null
25deepspeed: null
26device_map: auto
27dynamic_lora_per_layer: true
28early_stopping_patience: 3
29eval_max_new_tokens: 128
30eval_steps: 10241
31eval_table_size: null
32evaluation_strategy: steps
33flash_attention: false
34fp16: false
35fsdp: null
36fsdp_config: null
37gradient_accumulation_steps: 4
38gradient_checkpointing: true
39gradient_clip_val: 1.0
40group_by_length: false
41hub_model_id: JoshMe1/f9c3f23f-7a34-4334-8947-a41aec1d49b1
42hub_repo: null
43hub_strategy: checkpoint
44hub_token: null
45learning_rate: 0.0002
46load_in_4bit: false
47load_in_8bit: true
48local_rank: null
49logging_steps: 10
50lora_alpha: 256
51lora_dropout: 0.1
52lora_fan_in_fan_out: null
53lora_model_dir: null
54lora_r: 128
55lora_target_linear: true
56lr_finder: true
57lr_scheduler: cosine
58lr_scheduler_args: []
59max_grad_norm: 1.0
60max_memory:
61 0: 70GB
62max_steps: 10000
63micro_batch_size: 4
64mixed_precision: bf16
65mlflow_experiment_name: /tmp/f483f621ec4ec954_train_data.json
66model_type: AutoModelForCausalLM
67num_epochs: 10
68optimizer: adamw_torch_fused
69output_dir: miner_id_24
70pad_to_sequence_len: true
71s2_attention: null
72sample_packing: false
73save_steps: 10241
74save_strategy: steps
75save_total_limit: 3
76saves_per_epoch: null
77scheduler:
78 factor: 0.5
79 monitor: eval_loss
80 patience: 1
81 threshold: 0.005
82 type: ReduceLROnPlateau
83seed: 42
84sequence_len: 512
85special_tokens:
86 pad_token: <|endoftext|>
87strict: false
88tf32: false
89tokenizer_type: AutoTokenizer
90train_on_inputs: false
91training_stages:
92- learning_rate: 0.0002
93 name: warmup
94 num_train_epochs: 1
95- learning_rate: 2.0e-05
96 name: main
97trl:
98 ema: true
99 ema_decay: 0.999
100trust_remote_code: true
101val_set_size: 0.05
102wandb_entity: null
103wandb_mode: online
104wandb_name: de493da4-a11f-4036-a2d9-2001e9d5dbc8
105wandb_project: Gradients-On-Demand
106wandb_run: your_name
107wandb_runid: de493da4-a11f-4036-a2d9-2001e9d5dbc8
108warmup_steps: 1000
109weight_decay: 0.01
110xformers_attention: true
111| Training Loss | Epoch | Step | Validation Loss |
|---|---|---|---|
| No log | 0.0000 | 1 | 2.2481 |