1base_model: peft-internal-testing/tiny-dummy-qwen2
2batch_size: 32
3bf16: true
4chat_template: tokenizer_default_fallback_alpaca
5datasets:
6- format: custom
7 path: argilla/databricks-dolly-15k-curated-en
8 type:
9 field_input: original-instruction
10 field_instruction: original-instruction
11 field_output: original-response
12 format: '{instruction} {input}'
13 no_input_format: '{instruction}'
14 system_format: '{system}'
15 system_prompt: ''
16device_map: auto
17eval_sample_packing: false
18eval_steps: 200
19flash_attention: true
20gpu_memory_limit: 80GiB
21group_by_length: true
22hub_model_id: SystemAdmin123/tiny-dummy-qwen2
23hub_strategy: checkpoint
24learning_rate: 0.0002
25logging_steps: 10
26lr_scheduler: cosine
27max_steps: 2500
28micro_batch_size: 4
29model_type: AutoModelForCausalLM
30num_epochs: 100
31optimizer: adamw_bnb_8bit
32output_dir: /root/.sn56/axolotl/outputs/tiny-dummy-qwen2
33pad_to_sequence_len: true
34resize_token_embeddings_to_32x: false
35sample_packing: false
36save_steps: 400
37save_total_limit: 1
38sequence_len: 2048
39tokenizer_type: Qwen2TokenizerFast
40torch_dtype: bf16
41trust_remote_code: true
42val_set_size: 0.1
43wandb_entity: ''
44wandb_mode: online
45wandb_name: peft-internal-testing/tiny-dummy-qwen2-argilla/databricks-dolly-15k-curated-en
46wandb_project: Gradients-On-Demand
47wandb_run: your_name
48wandb_runid: default
49warmup_ratio: 0.05
50