Views
No views yet
Qwen/Qwen3-32BQwen/Qwen3-32B using our custom DFloat11 format. The outputs of this compressed model are bit-for-bit identical to the original BFloat16 model, while reducing GPU memory consumption by approximately 30%.1pip install dfloat11[cuda12]
2# or if you have CUDA version 11:
3# pip install dfloat11[cuda11]1import torch
2from dfloat11 import DFloat11Model
3from transformers import AutoTokenizer
4
5model_id = "DFloat11/Qwen3-32B-DF11"
6
7model = DFloat11Model.from_pretrained(model_id, device_map="auto")
8
9tokenizer = AutoTokenizer.from_pretrained(model_id)
10tokenizer.pad_token = tokenizer.eos_token
11
12prompt = "Question: What is a binary tree and its applications? Answer:"
13inputs = tokenizer(prompt, return_tensors="pt", padding=True).to(model.device)
14
15with torch.no_grad():
16 output = model.generate(
17 **inputs,
18 max_new_tokens=256,
19 do_sample=True,
20 )
21
22print(tokenizer.batch_decode(output, skip_special_tokens=True))