Views
No views yet
Service: RunPod
Datacenter: US-KS-2
GPU: 4 x A100 SXM (80 GiB)
CPU: 73 vCPU
RAM: 1150 GiB0.6.01base_model: /root/Hermes-3-Llama-3.1-405B
2tokenizer_type: AutoTokenizer
3
4load_in_4bit: true
5strict: false
6
7datasets:
8 - path: Guilherme34/uncensor
9 type: chat_template
10 chat_template: llama3
11 field_messages: messages
12 message_field_role: role
13 message_field_content: content
14 roles:
15 system:
16 - system
17 user:
18 - user
19 assistant:
20 - assistant
21dataset_prepared_path: last_run_prepared
22val_set_size: 0.0
23output_dir: ./outputs/out/Hermes-3-Llama-3.1-405B
24save_safetensors: true
25
26adapter: qlora
27
28sequence_len: 2048
29sample_packing: true
30pad_to_sequence_len: true
31
32lora_r: 16
33lora_alpha: 16
34lora_dropout: 0.05
35lora_target_modules:
36lora_target_linear: true
37
38gradient_accumulation_steps: 4
39micro_batch_size: 1
40num_epochs: 3
41optimizer: adamw_torch
42lr_scheduler: cosine
43learning_rate: 0.00001
44
45train_on_inputs: false
46group_by_length: false
47bf16: true
48tf32: true
49
50gradient_checkpointing: true
51gradient_checkpointing_kwargs:
52 use_reentrant: true
53logging_steps: 1
54flash_attention: true
55
56warmup_steps: 10
57evals_per_epoch: 2
58saves_per_epoch: 2
59save_total_limit: 20
60weight_decay: 0.0
61fsdp:
62 - full_shard
63 - auto_wrap
64fsdp_config:
65 fsdp_limit_all_gathers: true
66 fsdp_sync_module_states: true
67 fsdp_offload_params: true
68 fsdp_use_orig_params: false
69 fsdp_cpu_ram_efficient_loading: true
70 fsdp_auto_wrap_policy: TRANSFORMER_BASED_WRAP
71 fsdp_transformer_layer_cls_to_wrap: LlamaDecoderLayer
72 fsdp_state_dict_type: FULL_STATE_DICT
73 fsdp_sharding_strategy: FULL_SHARD
74special_tokens:
75 pad_token: <|finetune_right_pad_id|>
761{'loss': 0.743, 'grad_norm': 0.19568008184432983, 'learning_rate': 1.0000000000000002e-06, 'epoch': 0.06}
2{'loss': 0.9395, 'grad_norm': 0.1960965245962143, 'learning_rate': 2.0000000000000003e-06, 'epoch': 0.11}
3{'loss': 0.9456, 'grad_norm': 0.19083181023597717, 'learning_rate': 3e-06, 'epoch': 0.17}
4{'loss': 0.8674, 'grad_norm': 0.21329426765441895, 'learning_rate': 4.000000000000001e-06, 'epoch': 0.22}
5{'loss': 0.8332, 'grad_norm': 0.22335226833820343, 'learning_rate': 5e-06, 'epoch': 0.28}
6{'loss': 0.7133, 'grad_norm': 0.193553164601326, 'learning_rate': 6e-06, 'epoch': 0.33}
7{'loss': 0.9214, 'grad_norm': 0.1858656108379364, 'learning_rate': 7e-06, 'epoch': 0.39}
8{'loss': 0.9407, 'grad_norm': 0.214676171541214, 'learning_rate': 8.000000000000001e-06, 'epoch': 0.44}
9{'loss': 0.8862, 'grad_norm': 0.20595382153987885, 'learning_rate': 9e-06, 'epoch': 0.5}
10{'loss': 0.7367, 'grad_norm': 0.24974201619625092, 'learning_rate': 1e-05, 'epoch': 0.56}
11{'loss': 0.8232, 'grad_norm': 0.19453175365924835, 'learning_rate': 9.987260573051268e-06, 'epoch': 0.61}
12{'loss': 0.9059, 'grad_norm': 0.1651102900505066, 'learning_rate': 9.949107209404664e-06, 'epoch': 0.67}
13{'loss': 0.8703, 'grad_norm': 0.17140182852745056, 'learning_rate': 9.885734329855798e-06, 'epoch': 0.72}
14{'loss': 0.7074, 'grad_norm': 0.23574431240558624, 'learning_rate': 9.797464868072489e-06, 'epoch': 0.78}
15{'loss': 0.8139, 'grad_norm': 0.2225610464811325, 'learning_rate': 9.68474862499881e-06, 'epoch': 0.83}
16{'loss': 0.8215, 'grad_norm': 0.21732008457183838, 'learning_rate': 9.548159976772593e-06, 'epoch': 0.89}
17{'loss': 0.7565, 'grad_norm': 0.20930981636047363, 'learning_rate': 9.388394947836278e-06, 'epoch': 0.94}
18{'loss': 0.7212, 'grad_norm': 0.2180735021829605, 'learning_rate': 9.206267664155906e-06, 'epoch': 1.0}
19{'loss': 0.795, 'grad_norm': 0.19505858421325684, 'learning_rate': 9.002706204621802e-06, 'epoch': 1.06}
20{'loss': 0.7864, 'grad_norm': 0.15985409915447235, 'learning_rate': 8.778747871771293e-06, 'epoch': 1.11}
21{'loss': 0.8788, 'grad_norm': 0.14533071219921112, 'learning_rate': 8.535533905932739e-06, 'epoch': 1.17}
22{'loss': 0.7935, 'grad_norm': 0.16130374372005463, 'learning_rate': 8.274303669726427e-06, 'epoch': 1.22}
23{'loss': 0.7538, 'grad_norm': 0.2337110936641693, 'learning_rate': 7.996388332556735e-06, 'epoch': 1.28}
24{'loss': 0.792, 'grad_norm': 0.1405537873506546, 'learning_rate': 7.703204087277989e-06, 'epoch': 1.33}
25{'loss': 0.713, 'grad_norm': 0.15972167253494263, 'learning_rate': 7.396244933600285e-06, 'epoch': 1.39}
26{'loss': 0.7298, 'grad_norm': 0.13147059082984924, 'learning_rate': 7.0770750650094335e-06, 'epoch': 1.44}
27{'loss': 0.8924, 'grad_norm': 0.14095576107501984, 'learning_rate': 6.747320897995493e-06, 'epoch': 1.5}
28{'loss': 0.763, 'grad_norm': 0.12625615298748016, 'learning_rate': 6.408662784207149e-06, 'epoch': 1.56}
29{'loss': 0.6831, 'grad_norm': 0.1273408979177475, 'learning_rate': 6.062826447764883e-06, 'epoch': 1.61}
30{'loss': 0.8164, 'grad_norm': 0.11066637188196182, 'learning_rate': 5.711574191366427e-06, 'epoch': 1.67}
31{'loss': 0.7147, 'grad_norm': 0.10837733000516891, 'learning_rate': 5.356695915996162e-06, 'epoch': 1.72}
32{'loss': 0.7393, 'grad_norm': 0.11306577175855637, 'learning_rate': 5e-06, 'epoch': 1.78}
33{'loss': 0.8658, 'grad_norm': 0.09451240301132202, 'learning_rate': 4.643304084003839e-06, 'epoch': 1.83}
34{'loss': 0.741, 'grad_norm': 0.12831491231918335, 'learning_rate': 4.2884258086335755e-06, 'epoch': 1.89}
35{'loss': 0.7591, 'grad_norm': 0.10294996201992035, 'learning_rate': 3.937173552235117e-06, 'epoch': 1.94}
36{'loss': 1.2196, 'grad_norm': 0.10132957249879837, 'learning_rate': 3.5913372157928515e-06, 'epoch': 2.06}
37{'loss': 0.7569, 'grad_norm': 0.11689897626638412, 'learning_rate': 3.252679102004509e-06, 'epoch': 2.11}
38{'loss': 0.7079, 'grad_norm': 0.09816595911979675, 'learning_rate': 2.9229249349905686e-06, 'epoch': 2.17}
39{'loss': 0.7155, 'grad_norm': 0.09971238672733307, 'learning_rate': 2.603755066399718e-06, 'epoch': 2.22}
40{'loss': 0.7408, 'grad_norm': 0.096501424908638, 'learning_rate': 2.296795912722014e-06, 'epoch': 2.28}
41{'loss': 0.6515, 'grad_norm': 0.10212745517492294, 'learning_rate': 2.0036116674432653e-06, 'epoch': 2.33}
42{'loss': 0.7529, 'grad_norm': 0.09364734590053558, 'learning_rate': 1.7256963302735752e-06, 'epoch': 2.39}
43{'loss': 0.7507, 'grad_norm': 0.09163379669189453, 'learning_rate': 1.4644660940672628e-06, 'epoch': 2.44}
44{'loss': 0.7617, 'grad_norm': 0.09199802577495575, 'learning_rate': 1.2212521282287093e-06, 'epoch': 2.5}
45{'loss': 0.6267, 'grad_norm': 0.10740058124065399, 'learning_rate': 9.972937953781985e-07, 'epoch': 2.56}
46{'loss': 0.768, 'grad_norm': 0.0926344096660614, 'learning_rate': 7.937323358440935e-07, 'epoch': 2.61}
47{'loss': 0.7112, 'grad_norm': 0.0975445881485939, 'learning_rate': 6.116050521637218e-07, 'epoch': 2.67}
48{'loss': 0.612, 'grad_norm': 0.10543332248926163, 'learning_rate': 4.5184002322740784e-07, 'epoch': 2.72}
49{'loss': 0.7146, 'grad_norm': 0.09059547632932663, 'learning_rate': 3.1525137500119207e-07, 'epoch': 2.78}
50{'loss': 0.9639, 'grad_norm': 0.08704929798841476, 'learning_rate': 2.0253513192751374e-07, 'epoch': 2.83}
51{'loss': 0.6538, 'grad_norm': 0.09582456946372986, 'learning_rate': 1.1426567014420297e-07, 'epoch': 2.89}
52{'loss': 0.8819, 'grad_norm': 0.0968393087387085, 'learning_rate': 5.089279059533658e-08, 'epoch': 2.94}
53{'loss': 0.8495, 'grad_norm': 0.087490014731884, 'learning_rate': 1.2739426948732426e-08, 'epoch': 3.0}
54{'train_runtime': 26336.9864, 'train_samples_per_second': 0.106, 'train_steps_per_second': 0.002, 'train_loss': 0.7925106309494883, 'epoch': 3.0}