Views
No views yet
d1bb0951from auto_round import AutoRoundConfig ## must import for auto-round format
2from transformers import AutoModelForCausalLM, AutoTokenizer
3import torch
4
5quantized_model_dir = "OPEA/glm-4-9b-chat-int4-inc"
6
7model = AutoModelForCausalLM.from_pretrained(quantized_model_dir,
8 device_map=backend.split(':')[0], torch_dtype=torch.float16,
9 quantization_config=quantization_config,
10 trust_remote_code=True
11 ).eval()
12
13tokenizer = AutoTokenizer.from_pretrained(quantized_model_dir, trust_remote_code=True)
14query = "请介绍一下智谱华章科技有限公司"
15inputs = tokenizer.apply_chat_template([{"role": "user", "content": query}],
16 add_generation_prompt=True,
17 tokenize=True,
18 return_tensors="pt",
19 return_dict=True
20 )
21inputs = inputs.to(model.device)
22
23gen_kwargs = {"max_length": 50, "do_sample": False, "top_k": 1}##change this to follow official usage
24with torch.no_grad():
25 outputs = model.generate(**inputs, **gen_kwargs)
26 outputs = outputs[:, inputs['input_ids'].shape[1]:]
27 print(tokenizer.decode(outputs[0], skip_special_tokens=True))
28
291auto-round --eval --eval_bs 16 --tasks leaderboard_ifeval,leaderboard_mmlu_pro,gsm8k,lambada_openai,hellaswag,piqa,winogrande,truthfulqa_mc1,openbookqa,boolq,arc_easy,arc_challenge,cmmlu,ceval-valid
2| Metric | BF16 | INT4(6.4G) | INT4-quanted-lm-head(5.5G) |
|---|---|---|---|
| Avg | 0.6260 | 0.6230 | 0.6204 |
| leaderboard_mmlu_pro 5shot | 0.3678 | 0.3616 | 0.3610 |
| leaderboard_ifeval inst_level_strict_acc | 0.5504 | 0.5600 | 0.5588 |
| leaderboard_ifeval prompt_level_strict_acc | 0.4067 | 0.4233 | 0.4067 |
| cmmlu | 0.7213 | 0.7137 | 0.7086 |
| ceval-valid | 0.7065 | 0.7058 | 0.6909 |
| gsm8k 5shot strict match | 0.7794 | 0.7597 | 0.7589 |
| lambada_openai | 0.6608 | 0.6493 | 0.6470 |
| hellaswag | 0.6195 | 0.6137 | 0.6134 |
| winogrande | 0.7561 | 0.7545 | 0.7522 |
| piqa | 0.8030 | 0.7976 | 0.8003 |
| truthfulqa_mc1 | 0.4223 | 0.4223 | 0.4284 |
| openbookqa | 0.3560 | 0.3640 | 0.3580 |
| boolq | 0.8691 | 0.8606 | 0.8578 |
| arc_easy | 0.8241 | 0.8249 | 0.8203 |
| arc_challenge | 0.5469 | 0.5341 | 0.5444 |
1auto-round \
2--model THUDM/glm-4-9b-chat \
3--iter 1000 \
4--nsamples 512 \
5--disable_eval \
6--quant_lm_head \
7--format "auto_round"
8--output_dir "./tmp_autoround"