Views
No views yet
0.6.01base_model: trl-internal-testing/tiny-random-LlamaForCausalLM
2batch_size: 128
3bf16: true
4chat_template: tokenizer_default_fallback_alpaca
5datasets:
6- format: custom
7 path: argilla/databricks-dolly-15k-curated-en
8 type:
9 field_input: original-instruction
10 field_instruction: original-instruction
11 field_output: original-response
12 format: '{instruction} {input}'
13 no_input_format: '{instruction}'
14 system_format: '{system}'
15 system_prompt: ''
16device_map: auto
17eval_sample_packing: false
18eval_steps: 20
19flash_attention: true
20gradient_checkpointing: true
21group_by_length: true
22hub_model_id: SystemAdmin123/tiny-random-LlamaForCausalLMeb1f456b-f90f-49a6-8608-d32eb5cd2470
23hub_strategy: checkpoint
24learning_rate: 0.0002
25logging_steps: 10
26lr_scheduler: cosine
27max_steps: 10000
28micro_batch_size: 32
29model_type: AutoModelForCausalLM
30num_epochs: 100
31optimizer: adamw_bnb_8bit
32output_dir: /root/.sn56/axolotl/tmp/tiny-random-LlamaForCausalLMeb1f456b-f90f-49a6-8608-d32eb5cd2470
33pad_to_sequence_len: true
34resize_token_embeddings_to_32x: false
35sample_packing: true
36save_steps: 20
37save_total_limit: 1
38sequence_len: 2048
39tokenizer_type: LlamaTokenizerFast
40torch_dtype: bf16
41training_args_kwargs:
42 hub_private_repo: true
43trust_remote_code: true
44val_set_size: 0.1
45wandb_entity: ''
46wandb_mode: online
47wandb_name: trl-internal-testing/tiny-random-LlamaForCausalLM-argilla/databricks-dolly-15k-curated-en
48wandb_project: Gradients-On-Demand
49wandb_run: your_name
50wandb_runid: default
51warmup_ratio: 0.05
52| Training Loss | Epoch | Step | Validation Loss |
|---|---|---|---|
| No log | 0.1667 | 1 | 10.3764 |
| 10.3632 | 3.3333 | 20 | 10.3538 |
| 10.3073 | 6.6667 | 40 | 10.2840 |
| 10.2203 | 10.0 | 60 | 10.2082 |
| 10.1812 | 13.3333 | 80 | 10.1828 |
| 10.1767 | 16.6667 | 100 | 10.1817 |