Views
No views yet
0.5.01# =============================================================================
2# PHASE 2 V3 : SFT Réécriture - FORMAT COMPLETION (sans template Alpaca)
3# =============================================================================
4
5base_model: philipperen55/Qwen2.5-14B-style-MERGED-v3
6model_type: AutoModelForCausalLM
7tokenizer_type: AutoTokenizer
8trust_remote_code: true
9
10load_in_8bit: false
11load_in_4bit: false
12
13# =============================================================================
14# DATASET : Format completion pré-formaté (pas de template ajouté par Axolotl)
15# =============================================================================
16datasets:
17 - path: philipperen55/dataset41SFT
18 data_files: dataset41SFT.jsonl
19 type: completion
20 field: text
21
22dataset_prepared_path: /workspace/prepared_data
23val_set_size: 0.01
24output_dir: /workspace/output
25
26# =============================================================================
27# SÉQUENCE - SANS PACKING
28# =============================================================================
29sequence_len: 2048
30sample_packing: false
31pad_to_sequence_len: true
32
33# =============================================================================
34# TOKEN EOS EXPLICITE
35# =============================================================================
36special_tokens:
37 eos_token: "<|endoftext|>"
38 pad_token: "<|endoftext|>"
39
40# =============================================================================
41# LoRA
42# =============================================================================
43adapter: lora
44lora_r: 32
45lora_alpha: 64
46lora_dropout: 0.05
47lora_target_modules:
48 - q_proj
49 - k_proj
50 - v_proj
51 - o_proj
52 - gate_proj
53 - up_proj
54 - down_proj
55
56# =============================================================================
57# TRAINING - 40K PAIRES, 1 EPOCHS, LR 1e-5
58# =============================================================================
59gradient_accumulation_steps: 8
60micro_batch_size: 4
61num_epochs: 1
62learning_rate: 1e-5
63lr_scheduler: cosine
64warmup_ratio: 0.06
65optimizer: adamw_torch
66weight_decay: 0.01
67max_grad_norm: 1.0
68
69# =============================================================================
70# PRÉCISION
71# =============================================================================
72bf16: true
73fp16: false
74tf32: true
75
76# =============================================================================
77# OPTIMISATIONS
78# =============================================================================
79flash_attention: false
80gradient_checkpointing: true
81
82# --- Reproductibilité ---
83seed: 42
84
85# =============================================================================
86# LOGGING ET SAUVEGARDES
87# =============================================================================
88logging_steps: 10
89save_steps: 200
90eval_strategy: steps
91eval_steps: 200
92save_total_limit: 8
93
94# =============================================================================
95# WEIGHTS & BIASES
96# =============================================================================
97wandb_project: Qwen2.5-14B-dataset41SFT
98
99# =============================================================================
100# HUGGING FACE HUB
101# =============================================================================
102hub_model_id: philipperen55/Qwen2.5-14B-dataset41SFT
103push_to_hub: true
104hub_strategy: every_save
105| Training Loss | Epoch | Step | Validation Loss |
|---|---|---|---|
| No log | 0.0008 | 1 | 1.8784 |
| 1.6592 | 0.1616 | 200 | 1.6617 |
| 1.6717 | 0.3232 | 400 | 1.6493 |
| 1.6543 | 0.4848 | 600 | 1.6442 |
| 1.6484 | 0.6465 | 800 | 1.6413 |
| 1.6569 | 0.8081 | 1000 | 1.6402 |
| 1.6387 | 0.9697 | 1200 | 1.6398 |