Views
No views yet
pip install --no-deps git+https://github.com/electroglyph/trl.git@24EAFT====== Perplexity statistics ======
Mean PPL(Q) : 10.164880 ± 0.026138
Mean PPL(base) : 10.984474 ± 0.030165
Cor(ln(PPL(Q)), ln(PPL(base))): 99.35%
Mean ln(PPL(Q)/PPL(base)) : -0.077544 ± 0.000350
Mean PPL(Q)/PPL(base) : 0.925386 ± 0.000324
Mean PPL(Q)-PPL(base) : -0.819594 ± 0.005149
====== KL divergence statistics ======
Mean KLD: 0.034324 ± 0.000032
Maximum KLD: 4.381997
99.9% KLD: 0.275690
99.0% KLD: 0.149398
95.0% KLD: 0.095380
90.0% KLD: 0.075580
Median KLD: 0.027208
10.0% KLD: 0.000553
5.0% KLD: 0.000077
1.0% KLD: 0.000003
0.1% KLD: -0.000000
Minimum KLD: -0.000014
====== Token probability statistics ======
Mean Δp: -1.770 ± 0.004 %
Maximum Δp: 74.026%
99.9% Δp: 19.553%
99.0% Δp: 9.223%
95.0% Δp: 3.394%
90.0% Δp: 1.485%
75.0% Δp: 0.084%
Median Δp: -0.118%
25.0% Δp: -3.134%
10.0% Δp: -8.037%
5.0% Δp: -11.159%
1.0% Δp: -17.508%
0.1% Δp: -26.736%
Minimum Δp: -96.977%
RMS Δp : 5.061 ± 0.007 %
Same top p: 92.762 ± 0.023 %1EPOCHS = 2
2
3args = SFTConfig(
4 per_device_train_batch_size = 5,
5 gradient_accumulation_steps = 1,
6 warmup_steps = 20,
7 num_train_epochs = EPOCHS,
8 learning_rate = 6e-6,
9 optim = "adamw_torch_fused",
10 weight_decay = 0.01,
11 lr_scheduler_type = "cosine_with_restarts", # shuffled each epoch
12 lr_scheduler_kwargs={"num_cycles": EPOCHS},
13 seed = 888,
14 loss_type = "eaft",
15 eaft_alpha = 1.0,
16 ),