Views
No views yet
0.10.0.dev01adapter: lora
2attn_implementation: eager
3base_model: tiiuae/falcon-7b
4bf16: true
5datasets:
6- data_files:
7 - 2377e89d05129d78_train_data.json
8 ds_type: json
9 format: custom
10 path: /workspace/input_data/
11 type:
12 field_input: input
13 field_instruction: instruct
14 field_output: output
15 field_system: None
16 format: None
17 no_input_format: None
18 system_format: '{system}'
19 system_prompt: None
20eval_max_new_tokens: 128
21evals_per_epoch: 4
22flash_attention: false
23fp16: false
24gradient_accumulation_steps: 2
25gradient_checkpointing: true
26group_by_length: true
27hf_upload_public: true
28hf_upload_repo_type: model
29hub_model_id: cpheemagazine/5d5fd3e7-48ed-431e-9cfc-a70654740094
30learning_rate: 0.0002
31load_in_4bit: false
32logging_steps: 10
33lora_alpha: 16
34lora_dropout: 0.05
35lora_fan_in_fan_out: false
36lora_r: 8
37lora_target_linear: true
38lr_scheduler: cosine
39max_steps: 1134
40micro_batch_size: 4
41mlflow_experiment_name: /tmp/2377e89d05129d78_train_data.json
42optimizer: adamw_bnb_8bit
43output_dir: miner_id_24
44rl: null
45sample_packing: true
46save_steps: 170
47sequence_len: 1024
48special_tokens:
49 pad_token: <|endoftext|>
50tf32: true
51tokenizer_type: AutoTokenizer
52train_on_inputs: true
53trl: null
54trust_remote_code: false
55use_flash_attention: false
56wandb_name: 07464eb7-df94-4e74-8dc3-e49bf3912db7
57wandb_project: Gradients-On-Demand
58wandb_run: apriasmoro
59wandb_runid: 07464eb7-df94-4e74-8dc3-e49bf3912db7
60warmup_steps: 113
61weight_decay: 0.02
62