Views
No views yet
lm_head: Output layermlp.gate: MoE router gatesmlp.shared_expert_gate: Shared expert gates1from llmcompressor.modifiers.awq import AWQModifier
2
3recipe = [
4 AWQModifier(
5 ignore=["lm_head", "re:.*mlp.gate$", "re:.*mlp.shared_expert_gate$"],
6 scheme="W4A16",
7 targets=["Linear"],
8 ),
9]1from vllm import LLM, SamplingParams
2
3model = LLM(
4 model="NotoriousH2/kanana-2-30b-a3b-instruct-2601-awq-w4a16",
5 trust_remote_code=True,
6)
7
8sampling_params = SamplingParams(temperature=0.7, max_tokens=512)
9output = model.generate("고혈압 환자의 식이요법에 대해 설명해주세요.", sampling_params)
10print(output[0].outputs[0].text)1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained(
4 "NotoriousH2/kanana-2-30b-a3b-instruct-2601-awq-w4a16",
5 torch_dtype="auto",
6 device_map="auto",
7 trust_remote_code=True,
8)
9tokenizer = AutoTokenizer.from_pretrained(
10 "NotoriousH2/kanana-2-30b-a3b-instruct-2601-awq-w4a16",
11 trust_remote_code=True,
12)
13
14messages = [
15 {"role": "user", "content": "고혈압 환자의 식이요법에 대해 설명해주세요."}
16]
17
18input_ids = tokenizer.apply_chat_template(
19 messages,
20 return_tensors="pt",
21 add_generation_prompt=True,
22).to(model.device)
23
24output = model.generate(input_ids, max_new_tokens=512)
25print(tokenizer.decode(output[0], skip_special_tokens=True))