1base_model: facebook/opt-350m
2batch_size: 96
3bf16: true
4chat_template: tokenizer_default_fallback_alpaca
5datasets:
6- format: custom
7 path: argilla/databricks-dolly-15k-curated-en
8 type:
9 field_input: original-instruction
10 field_instruction: original-instruction
11 field_output: original-response
12 format: '{instruction} {input}'
13 no_input_format: '{instruction}'
14 system_format: '{system}'
15 system_prompt: ''
16device_map: auto
17eval_sample_packing: false
18eval_steps: 200
19flash_attention: true
20gradient_checkpointing: true
21group_by_length: true
22hub_model_id: SystemAdmin123/opt-350m
23hub_strategy: checkpoint
24learning_rate: 0.0002
25logging_steps: 10
26lr_scheduler: cosine
27max_steps: 10000
28micro_batch_size: 24
29model_type: AutoModelForCausalLM
30num_epochs: 100
31optimizer: adamw_bnb_8bit
32output_dir: /root/.sn56/axolotl/tmp/opt-350m
33pad_to_sequence_len: true
34resize_token_embeddings_to_32x: false
35sample_packing: true
36save_steps: 200
37save_total_limit: 1
38sequence_len: 2048
39tokenizer_type: GPT2TokenizerFast
40torch_dtype: bf16
41training_args_kwargs:
42 hub_private_repo: true
43trust_remote_code: true
44val_set_size: 0.1
45wandb_entity: ''
46wandb_mode: online
47wandb_name: facebook/opt-350m-argilla/databricks-dolly-15k-curated-en
48wandb_project: Gradients-On-Demand
49wandb_run: your_name
50wandb_runid: default
51warmup_ratio: 0.05
52