Views
No views yet
bert_sst2_int4_ste.pt — BERT SST-2 with L1-L3 INT4 quantization + STE retraining. Standard BERT state_dict, loadable directly. Accuracy: 90.1% (original FP32: 92.4%).results/bert/)bert_structural_prune.json — Per-layer structural pruning results (head/FFN reduction, accuracy)bert_sst2_all_prune.json — All-layer simultaneous FFN pruning resultsbert_l8_prune_results.json — L8 FFN correction + pruning (multi-seed)bert_quantize_results.json — INT4/INT8 post-training quantization resultsbert_quantize_retrain.json — INT4 STE retraining resultsresults/gpt2/)gpt2_structural_prune.json — Per-layer structural pruning (head + FFN)gpt2_each_layer_prune.json — Individual layer compression resultsgpt2_prune_validate.json — Pruning validation (PPL, accuracy)figures/fig1_ratio.png — FFN dual role ratio: BERT vs GPT-2 (log scale)figures/fig2_compression.png — Per-layer compression rates comparisonfigures/fig3_pruning.png — BERT SST-2 FFN neuron pruning curvefigures/fig4_quantization.png — INT4 quantization results (PTQ vs STE)