Views
No views yet
⚠️ Fake-quant fp16 checkpoint. The 3-bit weights are stored in fp16 (KronQ does not pack int3), so this repo is the same size as bf16 — no compression or speedup, for PPL / accuracy reproduction only. For deployable low-bit, see the W4A16 (packed int4) repo.
| PIQA | ARC-E | ARC-C | HellaSwag | WinoGrande | BoolQ | OBQA | Average |
|---|---|---|---|---|---|---|---|
| 77.53 | 74.54 | 50.17 | 74.92 | 71.74 | 81.13 | 41.20 | 67.32 |
acc_norm for PIQA/HellaSwag/ARC/OBQA, acc for WinoGrande/BoolQ.)1from transformers import AutoModelForCausalLM, AutoTokenizer
2m = AutoModelForCausalLM.from_pretrained("donghyunli/Meta-Llama-3-8B-KronQ-W3A16-fake", torch_dtype="float16").cuda()
3tok = AutoTokenizer.from_pretrained("donghyunli/Meta-Llama-3-8B-KronQ-W3A16-fake")--alpha 0.25, bidirectional incoherence processing (BiIP), act_order, raw H_G. Calibrated on 128 WikiText-2 sequences.