This repository contains an AWQ-quantized version of DeepSeek-R1-Distill-Llama-8B.
1from transformers import AutoTokenizer, AutoModelForCausalLM
2import torch
3
4model_id = "benyamini/DeepSeek-R1-Distill-Llama-8B-AWQ-w4g128"
5
6# === Load ===
7tok = AutoTokenizer.from_pretrained(model_id, use_fast=True, trust_remote_code=True)
8model = AutoModelForCausalLM.from_pretrained(
9 model_id,
10 torch_dtype=torch.float16,
11 device_map="cuda:0",
12 trust_remote_code=True,
13)
14
15# === Inference ===
16model.eval()
17inputs = tok("Hello", return_tensors="pt").to("cuda:0")
18with torch.no_grad():
19 out = model.generate(**inputs, max_new_tokens=20, do_sample=False)
20print(tok.decode(out[0], skip_special_tokens=True))