Views
No views yet

SYSTEM: Anda adalah asisten AI. Anda akan diberi tugas. Anda harus menghasilkan jawaban yang rinci dan panjang.
USER: <prompt> (without the <>)
ASSISTANT:asyafiqe/Merak-7B-v3-Mini-Orca-Indo-GPTQ.asyafiqe/Merak-7B-v3-Mini-Orca-Indo-GPTQMerak-7B-v3-Mini-Orca-Indo-GPTQGITHUB_ACTIONS=true pip install auto-gptq
pip install sentencepiece1from transformers import AutoTokenizer, pipeline, logging
2from auto_gptq import AutoGPTQForCausalLM, BaseQuantizeConfig
3
4model_name_or_path = "asyafiqe/Merak-7B-v3-Mini-Orca-Indo-GPTQ"
5model_basename = "Merak-7B-v3-Mini-Orca-Indo-GPTQ"
6
7use_triton = False
8
9tokenizer = AutoTokenizer.from_pretrained(model_name_or_path, use_fast=True)
10
11model = AutoGPTQForCausalLM.from_quantized(model_name_or_path,
12 model_basename=model_basename,
13 use_safetensors=True,
14 trust_remote_code=True,
15 device="cuda:0",
16 use_triton=use_triton,
17 quantize_config=None)
18
19
20prompt = "Buat rencana untuk menghemat listrik di rumah"
21system_message = "Anda adalah asisten AI. Anda akan diberi tugas. Anda harus menghasilkan jawaban yang rinci dan panjang.\n"
22prompt_template=f'''SYSTEM: {system_message}
23USER: {prompt}
24ASSISTANT: '''
25
26print("\n\n*** Generate:")
27
28input_ids = tokenizer(prompt_template, return_tensors='pt').input_ids.cuda()
29output = model.generate(inputs=input_ids, temperature=0.7, max_new_tokens=512)
30print(tokenizer.decode(output[0]))
31
32# Inference can also be done using transformers' pipeline
33
34# Prevent printing spurious transformers error when using pipeline with AutoGPTQ
35logging.set_verbosity(logging.CRITICAL)
36
37print("*** Pipeline:")
38pipe = pipeline(
39 "text-generation",
40 model=model,
41 tokenizer=tokenizer,
42 max_new_tokens=512,
43 temperature=0.7,
44 top_p=0.95,
45 repetition_penalty=1.15
46)
47
48print(pipe(prompt_template)[0]['generated_text'])