Views
No views yet
1from gptqmodel import GPTQModel 2model = GPTQModel.from_quantized("namgyu-youn/EXAONE-4.0-1.2B-GPTQ-W2A16", device="cuda:0")
1from vllm import LLM 2llm = LLM(model="namgyu-youn/EXAONE-4.0-1.2B-GPTQ-W2A16", dtype="float16")