Views
No views yet
| Base model | Qwen/Qwen3.5-27B |
| Quantization | BitsAndBytes NF4 (double quant) |
| Compute dtype | bfloat16 |
| Checkpoint size | ~16.7 GB |
| Model class | Qwen3_5ForConditionalGeneration |
| VRAM required | ~17 GB (fits on RTX 4090 24GB) |
1import torch
2from transformers import Qwen3_5ForConditionalGeneration, AutoProcessor
3
4model = Qwen3_5ForConditionalGeneration.from_pretrained(
5 "skkwowee/Qwen3.5-27B-bnb-4bit",
6 device_map="auto",
7 torch_dtype=torch.bfloat16,
8)
9processor = AutoProcessor.from_pretrained("skkwowee/Qwen3.5-27B-bnb-4bit")transformers 5.2 and bitsandbytes 0.49.1from transformers import Qwen3_5ForConditionalGeneration, BitsAndBytesConfig
2
3bnb_config = BitsAndBytesConfig(
4 load_in_4bit=True,
5 bnb_4bit_compute_dtype=torch.bfloat16,
6 bnb_4bit_quant_type="nf4",
7 bnb_4bit_use_double_quant=True,
8)
9
10model = Qwen3_5ForConditionalGeneration.from_pretrained(
11 "Qwen/Qwen3.5-27B",
12 quantization_config=bnb_config,
13 device_map="auto",
14 torch_dtype=torch.bfloat16,
15)