Views
No views yet
0.5.01# =============================================================================
2# PHASE 2 V3 : SFT Réécriture - FORMAT COMPLETION (sans template Alpaca)
3# =============================================================================
4
5base_model: philipperen55/Qwen2.5-14B-style-MERGED-v2
6model_type: AutoModelForCausalLM
7tokenizer_type: AutoTokenizer
8trust_remote_code: true
9
10load_in_8bit: false
11load_in_4bit: false
12
13# =============================================================================
14# DATASET : Format completion pré-formaté (pas de template ajouté par Axolotl)
15# =============================================================================
16datasets:
17 - path: philipperen55/dataset40FT
18 data_files: dataset40FT.jsonl
19 type: completion
20 field: text
21
22dataset_prepared_path: /workspace/prepared_data
23val_set_size: 0.05
24output_dir: /workspace/output
25
26# =============================================================================
27# SÉQUENCE - SANS PACKING
28# =============================================================================
29sequence_len: 2048
30sample_packing: false
31pad_to_sequence_len: true
32
33# =============================================================================
34# TOKEN EOS EXPLICITE
35# =============================================================================
36special_tokens:
37 eos_token: "<|endoftext|>"
38
39# =============================================================================
40# LoRA
41# =============================================================================
42adapter: lora
43lora_r: 32
44lora_alpha: 32
45lora_dropout: 0.05
46lora_target_modules:
47 - q_proj
48 - k_proj
49 - v_proj
50 - o_proj
51 - gate_proj
52 - up_proj
53 - down_proj
54
55# =============================================================================
56# TRAINING - 33K PAIRES, 2 EPOCHS, LR 1.5e-5
57# =============================================================================
58gradient_accumulation_steps: 2
59micro_batch_size: 8
60num_epochs: 2
61learning_rate: 1.5e-5
62lr_scheduler: cosine
63warmup_ratio: 0.05
64optimizer: adamw_torch
65
66# =============================================================================
67# PRÉCISION
68# =============================================================================
69bf16: true
70fp16: false
71tf32: true
72
73# =============================================================================
74# OPTIMISATIONS
75# =============================================================================
76flash_attention: false
77gradient_checkpointing: true
78
79# =============================================================================
80# LOGGING ET SAUVEGARDES
81# =============================================================================
82logging_steps: 50
83save_steps: 500
84eval_steps: 500
85save_total_limit: 8
86
87# =============================================================================
88# WEIGHTS & BIASES
89# =============================================================================
90wandb_project: Qwen2.5-14B-SFT-phase2-v3
91
92# =============================================================================
93# HUGGING FACE HUB
94# =============================================================================
95hub_model_id: philipperen55/Qwen2.5-14B-style-SFT-v3
96push_to_hub: true
97hub_strategy: every_save
98| Training Loss | Epoch | Step | Validation Loss |
|---|---|---|---|
| No log | 0.0005 | 1 | 1.6796 |
| 1.4216 | 0.2557 | 500 | 1.4063 |
| 1.3818 | 0.5114 | 1000 | 1.3881 |
| 1.3878 | 0.7671 | 1500 | 1.3792 |
| 1.3816 | 1.0228 | 2000 | 1.3741 |
| 1.3631 | 1.2784 | 2500 | 1.3711 |
| 1.3541 | 1.5341 | 3000 | 1.3693 |
| 1.3653 | 1.7898 | 3500 | 1.3685 |