1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained(
4 "hassanshka/Biomni-R0-32B-AWQ-INT4",
5 device_map="auto",
6 torch_dtype="auto",
7 trust_remote_code=True
8)
9tokenizer = AutoTokenizer.from_pretrained("hassanshka/Biomni-R0-32B-AWQ-INT4")
10
11# Inference
12messages = [{"role": "user", "content": "Your medical question here"}]
13inputs = tokenizer.apply_chat_template(messages, return_tensors="pt").to(model.device)
14outputs = model.generate(inputs, max_new_tokens=512)
15print(tokenizer.decode(outputs[0]))
1from llmcompressor.modifiers.awq import AWQModifier
2from llmcompressor import oneshot
3
4recipe = AWQModifier(
5 scheme="W4A16",
6 targets="Linear",
7 ignore=["lm_head"],
8)
9
10oneshot(
11 model=model,
12 dataset=calibration_data,
13 recipe=recipe,
14 max_seq_length=2048,
15 num_calibration_samples=len(calibration_data),
16)
If you use this model, please cite the original Biomni model.