Views
No views yet
compressed-tensors==0.13.0 버전에서 제작되었습니다.| Attribute | Value |
|---|---|
| Base Model | kakaocorp/kanana-2-30b-a3b-instruct |
| Quantization | AWQ (W4A16) |
| Bits | 4-bit weights, 16-bit activations |
| Calibration Dataset | ChuGyouk/Asan-AMC-Healthinfo |
| Quantization Tool | llmcompressor |
1AWQModifier(
2 ignore=["lm_head", "re:.*mlp.gate$", "re:.*mlp.shared_expert_gate$"],
3 scheme="W4A16",
4 targets=["Linear"],
5)lm_head: 출력 레이어는 양자화 제외mlp.gate: MoE 라우터 게이트는 양자화 제외shared_expert_gate: 공유 전문가 게이트는 양자화 제외pip install compressed-tensors==0.13.01from vllm import LLM, SamplingParams
2
3model = LLM(model="NotoriousH2/kanana-awq-w4a16")
4sampling_params = SamplingParams(temperature=0.7, max_tokens=512)
5
6prompt = "고혈압 환자의 식이요법에 대해 설명해주세요."
7output = model.generate([prompt], sampling_params)
8print(output[0].outputs[0].text)1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained(
4 "NotoriousH2/kanana-awq-w4a16",
5 torch_dtype="auto",
6 device_map="auto",
7)
8tokenizer = AutoTokenizer.from_pretrained("NotoriousH2/kanana-awq-w4a16")
9
10messages = [{"role": "user", "content": "고혈압 환자의 식이요법에 대해 설명해주세요."}]
11input_ids = tokenizer.apply_chat_template(messages, return_tensors="pt").to(model.device)
12output = model.generate(input_ids, max_new_tokens=512)
13print(tokenizer.decode(output[0], skip_special_tokens=True))