Views
No views yet
meta-llama/Meta-Llama-3-8B-Instruct1from transformers import AutoTokenizer, AutoModelForCausalLM
2from peft import PeftModel
3import torch
4
5# 베이스 모델 로드
6base_model = "meta-llama/Meta-Llama-3-8B-Instruct"
7tokenizer = AutoTokenizer.from_pretrained(base_model)
8model = AutoModelForCausalLM.from_pretrained(
9 base_model,
10 torch_dtype=torch.float16,
11 device_map="auto"
12)
13
14# LoRA 어댑터 적용
15model = PeftModel.from_pretrained(model, "2shlee/llama3-8b-ko-chat-v1")
16
17# 추론
18messages = [{"role": "user", "content": "안녕하세요!"}]
19input_text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
20inputs = tokenizer(input_text, return_tensors="pt").to(model.device)
21
22with torch.no_grad():
23 outputs = model.generate(**inputs, max_new_tokens=256, temperature=0.7)
24
25response = tokenizer.decode(outputs[0], skip_special_tokens=True)
26print(response)1python -m vllm.entrypoints.openai.api_server \
2 --model meta-llama/Meta-Llama-3-8B-Instruct \
3 --enable-lora \
4 --lora-modules ko-chat=2shlee/llama3-8b-ko-chat-v11@misc{2shlee_llama3_8b_ko_chat_v1},
2 author = {shlee},
3 title = {2shlee/llama3-8b-ko-chat-v1},
4 year = {2026},
5 publisher = {Hugging Face},
6 howpublished = {\url{https://huggingface.co/2shlee/llama3-8b-ko-chat-v1}}
7}