Views
No views yet
0.4.11base_model: alpindale/Mistral-7B-v0.2-hf
2tokenizer_type: AutoTokenizer
3is_mistral_derived_model: true
4load_in_8bit: false
5load_in_4bit: false
6strict: false
7
8datasets:
9 - path: json
10 data_files: hidden_pretraining_manners.jsonl
11 ds_type: json
12 type: completion
13
14
15dataset_prepared_path: last_run_prepared
16output_dir: ./army-pretraining
17
18sequence_len: 4096
19sample_packing: false
20pad_to_sequence_len: true
21shuffle_merged_datasets: true
22
23wandb_project: mistral-army
24wandb_entity:
25wandb_watch:
26wandb_run_id:
27wandb_log_model:
28
29gradient_accumulation_steps: 6
30micro_batch_size: 2
31eval_batch_size: 1
32num_epochs: 11
33optimizer: paged_adamw_8bit
34lr_scheduler: cosine
35learning_rate: 0.000020
36weight_decay: 0
37# Gradient clipping max norm
38max_grad_norm: 1.0
39noisy_embedding_alpha: 0
40train_on_inputs: false
41group_by_length: false
42bf16: true
43fp16: false
44tf32: false
45
46gradient_checkpointing: unsloth
47early_stopping_patience:
48resume_from_checkpoint:
49logging_steps: 1
50xformers_attention:
51flash_attention: true
52
53chat_template: chatml
54
55warmup_ratio: 0.5
56auto_resume_from_checkpoints: false
57#warmup_ratio: 0.5
58eval_steps: 10
59saves_per_epoch: 1
60eval_sample_packing: false
61save_total_limit: 3
62debug:
63deepspeed: deepspeed_configs/zero2.json
64special_tokens:
65 pad_token: "<|end_of_text|>"