Views
No views yet
1{
2 "quant_method": "compressed-tensors",
3 "format": "pack-quantized",
4 "bits": 4,
5 "group_size": 128,
6 "symmetric": true,
7 "type": "int"
8}1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained(
4 "Ishant86/FuseO1-DeepSeekR1-QwQ-SkyT1-32B-compressed-tensors-int4",
5 device_map="auto",
6 trust_remote_code=True,
7)
8
9tokenizer = AutoTokenizer.from_pretrained(
10 "Ishant86/FuseO1-DeepSeekR1-QwQ-SkyT1-32B-compressed-tensors-int4"
11)
12
13prompt = "Explain the concept of quantum entanglement in simple terms."
14inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
15outputs = model.generate(**inputs, max_new_tokens=200)
16response = tokenizer.decode(outputs[0], skip_special_tokens=True)
17print(response)1from vllm import LLM, SamplingParams
2
3llm = LLM(
4 model="Ishant86/FuseO1-DeepSeekR1-QwQ-SkyT1-32B-compressed-tensors-int4",
5 quantization="compressed-tensors",
6 tensor_parallel_size=2, # Use 2 GPUs
7 gpu_memory_utilization=0.85,
8)
9
10sampling_params = SamplingParams(temperature=0.7, top_p=0.9, max_tokens=200)
11outputs = llm.generate(
12 ["Explain the concept of quantum entanglement in simple terms."],
13 sampling_params
14)
15print(outputs[0].outputs[0].text)