Views
No views yet
⚠️ Fake-quant fp16 checkpoint. The 3-bit weights are stored in fp16 (KronQ does not pack int3), so this repo is the same size as bf16 — no compression or speedup, for PPL / accuracy reproduction only. For deployable low-bit, see the W4A16 / W2A16 (packed int4/int2) repos.
| PIQA | ARC-E | ARC-C | HellaSwag | WinoGrande | BoolQ | OBQA | Average |
|---|---|---|---|---|---|---|---|
| 76.93 | 70.92 | 43.26 | 72.47 | 67.17 | 72.51 | 41.40 | 63.52 |
acc_norm for PIQA/HellaSwag/ARC/OBQA, acc for WinoGrande/BoolQ.)1from transformers import AutoModelForCausalLM, AutoTokenizer
2m = AutoModelForCausalLM.from_pretrained("donghyunli/Llama-2-7b-KronQ-W3A16-fake", torch_dtype="float16").cuda()
3tok = AutoTokenizer.from_pretrained("donghyunli/Llama-2-7b-KronQ-W3A16-fake")--alpha 0.25, bidirectional incoherence processing (BiIP), act_order, raw H_G. Calibrated on 128 WikiText-2 sequences.