Views
No views yet
Qwen/Qwen3-8Bnew FP8 backend, per-token float8_e4m3fn quantization)inference-optimization/Dataset-Qwen3-235B-Instruct...-fp8ablation-bf16 / ...-fp8ablation-fp8) trained
identically except for the hidden-states transfer precision, to isolate the effect of
FP8 quantization on speculator quality. See the sibling repo for the other precision.loss_epoch: 0.669430full_acc_epoch: 0.190271position_1_acc_epoch: 0.672740position_2_acc_epoch: 0.472040position_3_acc_epoch: 0.345522position_4_acc_epoch: 0.260192position_5_acc_epoch: 0.199753position_6_acc_epoch: 0.156152position_7_acc_epoch: 0.124998position_8_acc_epoch: 0.103757position_9_acc_epoch: 0.089780position_10_acc_epoch: 0.080512position_11_acc_epoch: 0.074648position_12_acc_epoch: 0.071026position_13_acc_epoch: 0.067589position_14_acc_epoch: 0.064986position_15_acc_epoch: 0.062941eal_epoch: 1.169300acceptance.csv in this repo for the full per-subset guidellm breakdown (9 subset rows).