Views
No views yet
lm_head 保持未量化,加载时不需要额外 LoRA。6.11 GB。16.40 GB 的 BF16 参照值来自同架构 Base-BF16 checkpoint;LoRA 合并不改变模型参数规模,因此可用于体积量级对照,但不是一份单独归档的 V24-BF16 文件体积测量。0.6900→0.7111,金额 F1 为 0.8133→0.7771,时间 F1 为 0.6299→0.6758。4 增至 7,说明量化同时移动了抽取边界,并非无损升级。1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3repo = "haofue2i1z3/Qwen3-8B-Legal-AWQ"
4tokenizer = AutoTokenizer.from_pretrained(repo, trust_remote_code=True)
5model = AutoModelForCausalLM.from_pretrained(repo, device_map="auto", torch_dtype="auto")compressed-tensors 量化格式的较新 Transformers/vLLM 环境。