1base_model: EleutherAI/pythia-14m
2batch_size: 128
3bf16: true
4chat_template: tokenizer_default_fallback_alpaca
5datasets:
6- format: custom
7 path: argilla/databricks-dolly-15k-curated-en
8 type:
9 field_input: original-instruction
10 field_instruction: original-instruction
11 field_output: original-response
12 format: '{instruction} {input}'
13 no_input_format: '{instruction}'
14 system_format: '{system}'
15 system_prompt: ''
16device_map: auto
17eval_sample_packing: false
18eval_steps: 20
19flash_attention: true
20gradient_checkpointing: true
21group_by_length: true
22hub_model_id: SystemAdmin123/pythia-14m
23hub_strategy: checkpoint
24learning_rate: 0.0002
25logging_steps: 10
26lr_scheduler: cosine
27max_steps: 10000
28micro_batch_size: 32
29model_type: AutoModelForCausalLM
30num_epochs: 100
31optimizer: adamw_bnb_8bit
32output_dir: /root/.sn56/axolotl/tmp/pythia-14m
33pad_to_sequence_len: true
34resize_token_embeddings_to_32x: false
35sample_packing: true
36save_steps: 20
37save_total_limit: 1
38sequence_len: 2048
39special_tokens:
40 pad_token: <|endoftext|>
41tokenizer_type: GPTNeoXTokenizerFast
42torch_dtype: bf16
43training_args_kwargs:
44 hub_private_repo: true
45trust_remote_code: true
46val_set_size: 0.1
47wandb_entity: ''
48wandb_mode: online
49wandb_name: EleutherAI/pythia-14m-argilla/databricks-dolly-15k-curated-en
50wandb_project: Gradients-On-Demand
51wandb_run: your_name
52wandb_runid: default
53warmup_ratio: 0.05
54