Views
No views yet
1
2import torch
3from transformers import AutoTokenizer, AutoModelForCausalLM, pipeline
4
5BASE_MODEL = "sh2orc/Llama-3-Korean-8B"
6
7model = AutoModelForCausalLM.from_pretrained(BASE_MODEL,
8 torch_dtype=torch.bfloat16,
9 attn_implementation="flash_attention_2",
10 device_map="cuda:0")
11
12tokenizer = AutoTokenizer.from_pretrained(BASE_MODEL)
13tokenizer.pad_token = tokenizer.eos_token
14tokenizer.padding_side = 'right'
15
16instruction = '할부 결제 대해서 설명해줘'
17
18pipe = pipeline("text-generation",
19 model=model,
20 tokenizer=tokenizer,
21 max_new_tokens=1024)
22
23messages = [
24 {"role": "user", "content": instruction},
25]
26
27prompt = pipe.tokenizer.apply_chat_template(
28 messages,
29 tokenize=False,
30 add_generation_prompt=True
31)
32
33outputs = pipe(
34 prompt,
35 do_sample=True,
36 temperature=0.8,
37 top_k=10,
38 top_p=0.9,
39 add_special_tokens=True,
40 eos_token_id = [
41 pipe.tokenizer.eos_token_id,
42 pipe.tokenizer.convert_tokens_to_ids("<|eot_id|>")
43 ]
44)
45
46print(outputs[0]['generated_text'][len(prompt):])
47print(outputs[0]['generated_text'][len(prompt):])1from vllm import LLM, SamplingParams
2from transformers import AutoTokenizer, pipeline
3
4BASE_MODEL = "sh2orc/Llama-3-Korean-8B"
5
6llm = LLM(model=BASE_MODEL)
7
8tokenizer = AutoTokenizer.from_pretrained(BASE_MODEL)
9tokenizer.pad_token = tokenizer.eos_token
10tokenizer.padding_side = 'right'
11
12instruction = '카드 할부 결제에 대해서 알려줘'
13
14messages = [
15 {
16 "role": "system",
17 "content": "당신은 훌륭한 AI 비서입니다. You are a great AI assistant."
18 },
19 {
20 "role": "user",
21 "content": instruction
22 },
23]
24
25
26prompt_message = tokenizer.apply_chat_template(
27 messages,
28 tokenize=False,
29 add_generation_prompt=True,
30)
31
32eos_token_id = [tokenizer.eos_token_id, tokenizer.convert_tokens_to_ids("<|eot_id|>")]
33
34outputs = llm.generate(prompt_message, SamplingParams(stop_token_ids=eos_token_id, temperature=0.6, top_p=0.8,max_tokens=4096))
35
36for output in outputs:
37 propt = output.prompt
38 generated_text = output.outputs[0].text
39 print(generated_text)
40