Views
No views yet

1pip3 install --upgrade transformers optimum
2# If using PyTorch 2.1 + CUDA 12.x:
3pip3 install --upgrade auto-gptq
4# or, if using PyTorch 2.1 + CUDA 11.x:
5pip3 install --upgrade auto-gptq --extra-index-url https://huggingface.github.io/autogptq-index/whl/cu118/1pip3 uninstall -y auto-gptq
2git clone https://github.com/PanQiWei/AutoGPTQ
3cd AutoGPTQ
4git checkout v0.5.1
5pip3 install .1from transformers import AutoModelForCausalLM, AutoTokenizer, pipeline
2model_name_or_path = "daptheHuman/Merak-7B-v4-GPTQ"
3# To use a different branch, change revision
4# For example: revision="gptq-4bit-32g-actorder_True"
5model = AutoModelForCausalLM.from_pretrained(model_name_or_path,
6 device_map="auto",
7 trust_remote_code=False,
8 revision="main")
9tokenizer = AutoTokenizer.from_pretrained(model_name_or_path, use_fast=True)
10prompt = "Tell me about AI"
11prompt_template=f'''### Instruction:
12{prompt}
13### Response:
14'''
15print("\n\n*** Generate:")
16input_ids = tokenizer(prompt_template, return_tensors='pt').input_ids.cuda()
17output = model.generate(inputs=input_ids, temperature=0.7, do_sample=True, top_p=0.95, top_k=40, max_new_tokens=512)
18print(tokenizer.decode(output[0]))
19# Inference can also be done using transformers' pipeline
20print("*** Pipeline:")
21pipe = pipeline(
22 "text-generation",
23 model=model,
24 tokenizer=tokenizer,
25 max_new_tokens=512,
26 do_sample=True,
27 temperature=0.7,
28 top_p=0.95,
29 top_k=40,
30 repetition_penalty=1.1
31)
32print(pipe(prompt_template)[0]['generated_text'])