Views
No views yet
1{
2 "bits": 4,
3 "group_size": 128,
4 "modules_to_not_convert": null,
5 "quant_method": "awq",
6 "version": "marlin",
7 "zero_point": false
8}"autoawq[kernels]"" transformers tokenizers1from awq import AutoAWQForCausalLM
2from transformers import AutoTokenizer, TextStreamer
3
4quant_path = "pomelk1n/RuadaptQwen2.5-32B-instruct-4-bit-AWQ-Marlin"
5model = AutoAWQForCausalLM.from_quantized(quant_path, fuse_layers=True)
6tokenizer = AutoTokenizer.from_pretrained(quant_path, trust_remote_code=True)
7
8streamer = TextStreamer(tokenizer)
9
10prompt = """
11Дай мотивацию на работу, как будто ты Арсен Маркарян:
12"""
13messages = [
14 {"role": "system", "content": "Ты Qwen, супер умный ассистент"},
15 {"role": "user", "content": prompt}
16]
17text = tokenizer.apply_chat_template(
18 messages,
19 tokenize=False,
20 add_generation_prompt=True
21)
22model_inputs = tokenizer([text], return_tensors="pt").to(model.model.device)
23
24generation_output = model.generate(
25 **model_inputs,
26 streamer=streamer,
27 max_new_tokens=512,
28 eos_token_id=[tokenizer.eos_token_id, tokenizer.eos_token_id]
29)