Qwen3.5-4B-NQ-gdnw8 (mixed-precision recovery variant)
JD97/Qwen3.5-4B-NQ 기반. GDN linear_attn 입력 projection(in_proj_qkv, in_proj_z)을 W4→W8로 bump해
GPQA razor-thin 미달(NQ full GPQA=0.6212, gate 0.630) 회복을 노린 변형.
구성 (NQ 대비 변경점만)
- group_0: W4 g32 (Linear body: MLP, GDN out_proj)
- group_1: W8 g32 (linear_attn.in_proj_qkv, in_proj_z) ← bumped (SSM 입력 projection, 민감)
- group_2: W8 g32 (lm_head, NQ와 동일)
- ignore(BF16): linear_attn.in_proj_a/b, full-attn q/k/v/o(8층), vision, MTP, embed
- RTN(data-free) 양자화. 멀티모달 구조 보존.
서빙
NQ와 동일하게 docker/lmhead-quant.patch(W8 lm_head용 패치 vLLM) 필요. docker/serve.py 참조.
근거
KL forward-only sensitivity 연구(SSM-Transformer 하이브리드)상 SSM 입력/cross-projection이 가장 민감,
decay(dt/a-b)는 둔감. NQ가 a/b는 BF16 보존하면서 민감한 in_proj는 W4로 깎은 배분을 교정.