Views
No views yet
flint/data/flint-section-aware.jsonl (552 rows, 3 epochs,
LoRA r=64).| suite | this model | original Qwen3.5-4B |
|---|---|---|
| gsm8k@t0.0 | 0.66 (3483.3 tok, loops 0.22) | 0.575 (4413.4 tok, loops 0.2167) |
| math500@t0.0 | 0.49 (5472.3 tok, loops 0.18) | 0.3083 (6631.6 tok, loops 0.2833) |
1{
2 "arm": "sft-flint-section-v2-3ep",
3 "dataset": "flint/data/flint-section-aware.jsonl",
4 "rows": 552,
5 "dropped_overlong": 0,
6 "epochs": 3,
7 "system_prompts": true,
8 "lora": {
9 "r": 64,
10 "alpha": 128,
11 "dropout": 0.0,
12 "target": "all"
13 },
14 "train": {
15 "epochs": 2,
16 "lr": 0.0002,
17 "batch_size": 1,
18 "grad_accum": 16,
19 "warmup_ratio": 0.03,
20 "lr_scheduler": "cosine",
21 "weight_decay": 0.01,
22 "seed": 3407,
23 "logging_steps": 10,
24 "save_strategy": "epoch"
25 },
26 "model": {
27 "name": "Qwen/Qwen3.5-4B",
28 "max_seq_length": 13312,
29 "load_in_4bit": true,
30 "chat_template": "qwen3.5"
31 },
32 "train_runtime_s": 7129.7994,
33 "final_loss": 0.18160040378570558,
34 "log_history": [
35 {
36 "loss": 0.3623380422592163,
37 "grad_norm": 0.20898976922035217,
38 "learning_rate": 0.0001987930439740757,
39 "epoch": 0.2898550724637681,
40 "step": 10
41 },
42 {
43 "loss": 0.3434292793273926,
44 "grad_norm": 0.19094254076480865,
45 "learning_rate": 0.00018931150161867916,
46 "epoch": 0.5797101449275363,
47 "step": 20
48 },
49 {
50 "loss": 0.34574434757232664,
51 "grad_norm": 0.16883905231952667,
52 "learning_rate": 0.00017125839641475072,
53 "epoch": 0.8695652173913043,
54 "step": 30
55 },
56 {
57 "loss": 0.26570911407470704,
58 "grad_norm": 0.15527313947677612,
59 "learning_rate": 0.00014636635319853275,
60 "epoch": 1.144927536231884,
61 "step": 40
62 },
63 {
64 "loss": 0.23108193874359131,
65 "grad_norm": 0.16759531199932098,
66 "learning_rate": 0.00011702435557223987,
67 "epoch": 1.434782608695652,
68 "step": 50
69 },
70 {
71 "loss": 0.23632392883300782,
72 "grad_norm": 0.16645948588848114,
73 "learning_rate": 8.604846610560771e-05,
74 "epoch": 1.7246376811594204,
75 "step": 60
76 },
77 {
78 "loss": 0.24004652500152587,
79 "grad_norm": 0.2916702926158905,
80 "learning_rate": 5.6411558152462894e-05,
81 "epoch": 2.0,
82 "step": 70
83 },
84 {
85 "loss": 0.17817842960357666,
86 "grad_norm": 0.16276057064533234,
87 "learning_rate": 3.0957997942825336e-05,
88 "epoch": 2.289855072463768,
89 "step": 80
90 },
91 {
92 "loss": 0.17362045049667357,
93 "grad_norm": 0.18809917569160461,
94 "learning_rate": 1.2130659990073146e-05,
95 "epoch": 2.579710144927536,
96 "step": 90
97 },
98 {
99 "loss": 0.18160040378570558,
100 "grad_norm": 0.16632623970508575,
101 "learning_rate": 1.7364751777736332e-06,
102 "epoch": 2.869565217391304,
103 "step": 100
104 },
105 {
106 "train_runtime": 7129.7994,
107 "train_samples_per_second": 0.232,
108 "train_steps_per_second": 0.015,
109 "total_flos": 2.0013017119053005e+17,
110 "train_loss": 0.2515000207083566,
111 "epoch": 3.0,
112 "step": 105
113 }
114 ]
115}