Views
No views yet
vLLM or AutoAWQ for optimized inference.1from awq import AutoAWQForCausalLM
2from transformers import AutoTokenizer
3
4model_id = "umyunsang/GovOn-EXAONE-AWQ-v2"
5
6tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
7model = AutoAWQForCausalLM.from_quantized(model_id, fuse_layers=True, trust_remote_code=True)
8
9# (Inference code same as Merged-v2)<thought>) or nuanced reasoning might occur compared to the BF16 version.