Views
No views yet
flint/data/flint-mixed.jsonl (571 rows, 2 epochs,
LoRA r=64).| suite | this model | original Qwen3.5-4B |
|---|---|---|
| gsm8k@t0.0 | 0.86 (1595.3 tok, loops 0.07) | 0.575 (4413.4 tok, loops 0.2167) |
| humaneval@t0.0 | 0.33 (6871.8 tok, loops 0.28) | 0.9083 (821.5 tok, loops 0.0083) |
| loops:gsm8k@t0.0 | 0.84 (1892.6 tok, loops 0.12) | 0.64 (3915.1 tok, loops 0.28) |
| loops:gsm8k@t0.6 | 0.88 (1681.3 tok, loops 0.02) | 0.68 (3827.4 tok, loops 0.12) |
| loops:gsm8k@t1.0 | 0.76 (2837.1 tok, loops 0.18) | 0.74 (4140.6 tok, loops 0.0) |
| math500@t0.0 | 0.53 (4993.4 tok, loops 0.17) | 0.3083 (6631.6 tok, loops 0.2833) |
| mbpp@t0.0 | 0.27 (6913.8 tok, loops 0.34) | 0.75 (1564.8 tok, loops 0.0083) |
1{
2 "arm": "sft-flint-mixed-v2",
3 "dataset": "flint/data/flint-mixed.jsonl",
4 "rows": 571,
5 "dropped_overlong": 0,
6 "epochs": 2,
7 "system_prompts": true,
8 "lora": {
9 "r": 64,
10 "alpha": 128,
11 "dropout": 0.0,
12 "target": "all"
13 },
14 "train": {
15 "epochs": 2,
16 "lr": 0.0002,
17 "batch_size": 1,
18 "grad_accum": 16,
19 "warmup_ratio": 0.03,
20 "lr_scheduler": "cosine",
21 "weight_decay": 0.01,
22 "seed": 3407,
23 "logging_steps": 10,
24 "save_strategy": "epoch"
25 },
26 "model": {
27 "name": "Qwen/Qwen3.5-4B",
28 "max_seq_length": 13312,
29 "load_in_4bit": true,
30 "chat_template": "qwen3.5"
31 },
32 "train_runtime_s": 4257.3918,
33 "final_loss": 0.20572218894958497,
34 "log_history": [
35 {
36 "loss": 0.3235448122024536,
37 "grad_norm": 0.1792268007993698,
38 "learning_rate": 0.00019629172873477995,
39 "epoch": 0.28021015761821366,
40 "step": 10
41 },
42 {
43 "loss": 0.30161023139953613,
44 "grad_norm": 0.1683519035577774,
45 "learning_rate": 0.00017461836858476856,
46 "epoch": 0.5604203152364273,
47 "step": 20
48 },
49 {
50 "loss": 0.2957916736602783,
51 "grad_norm": 0.12694813311100006,
52 "learning_rate": 0.00013774191957526143,
53 "epoch": 0.840630472854641,
54 "step": 30
55 },
56 {
57 "loss": 0.27068142890930175,
58 "grad_norm": 0.16031979024410248,
59 "learning_rate": 9.317575866353292e-05,
60 "epoch": 1.1120840630472855,
61 "step": 40
62 },
63 {
64 "loss": 0.2206240177154541,
65 "grad_norm": 0.14184938371181488,
66 "learning_rate": 5.000000000000002e-05,
67 "epoch": 1.3922942206654991,
68 "step": 50
69 },
70 {
71 "loss": 0.2086726188659668,
72 "grad_norm": 0.17701619863510132,
73 "learning_rate": 1.7011470800097496e-05,
74 "epoch": 1.6725043782837128,
75 "step": 60
76 },
77 {
78 "loss": 0.20572218894958497,
79 "grad_norm": 0.15691602230072021,
80 "learning_rate": 9.314053963669245e-07,
81 "epoch": 1.9527145359019265,
82 "step": 70
83 },
84 {
85 "train_runtime": 4257.3918,
86 "train_samples_per_second": 0.268,
87 "train_steps_per_second": 0.017,
88 "total_flos": 1.520973357373317e+17,
89 "train_loss": 0.25957077369093895,
90 "epoch": 2.0,
91 "step": 72
92 }
93 ]
94}