Views
No views yet
sarvamai/sarvam-30b using bitsandbytes.
The quantization significantly reduces GPU memory usage while preserving strong inference performance.sarvamai/sarvam-30bSarvamMoEForCausalLM| Model | GPU VRAM |
|---|---|
| FP16 original | ~60 GB |
| 4-bit NF4 | ~16-18 GB |
pip install transformers accelerate bitsandbytes torch safetensors1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained(
4 "neuralnets/sarvam-30b-4bit",
5 device_map="auto",
6 trust_remote_code=True
7)
8
9tokenizer = AutoTokenizer.from_pretrained(
10 "neuralnets/sarvam-30b-4bit",
11 trust_remote_code=True
12)1prompt = "Explain mixture of experts in simple terms."
2
3inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
4
5outputs = model.generate(
6 **inputs,
7 max_new_tokens=200
8)
9
10print(tokenizer.decode(outputs[0], skip_special_tokens=True))trust_remote_code=True.sarvamai/sarvam-30bsarvamai/sarvam-30b