Views
No views yet
LGAI-EXAONE/EXAONE-3.5-7.8B-Instruct| Branch | 설명 |
|---|---|
main | 학습 종료 시점의 최종 어댑터 |
checkpoint-100 | step 100 |
checkpoint-200 | step 200 |
checkpoint-300 | step 300 |
checkpoint-400 | step 400 |
checkpoint-500 | step 500 |
checkpoint-600 | step 600 |
checkpoint-679 | step 679 |
1from peft import PeftModel
2from transformers import AutoModelForCausalLM, AutoTokenizer
3
4REPO = "xxccho/EXAONE-GRPO-lg_convfin_mcq_grpo_ratio1.0_gen8_bs4_lr7e-6_beta0.04"
5BASE = "LGAI-EXAONE/EXAONE-3.5-7.8B-Instruct"
6
7tokenizer = AutoTokenizer.from_pretrained(REPO, trust_remote_code=True)
8base = AutoModelForCausalLM.from_pretrained(BASE, trust_remote_code=True, torch_dtype="bfloat16")
9model = PeftModel.from_pretrained(base, REPO)
10
11prompt = tokenizer.apply_chat_template(
12 [{"role": "user", "content": "What is the price-to-earnings ratio?"}],
13 tokenize=False, add_generation_prompt=True,
14)
15inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
16out = model.generate(**inputs, max_new_tokens=256, do_sample=False)
17print(tokenizer.decode(out[0][inputs["input_ids"].shape[1]:], skip_special_tokens=True))revision 인자로 branch를 지정:model = PeftModel.from_pretrained(base, REPO, revision="checkpoint-100")1vllm serve LGAI-EXAONE/EXAONE-3.5-7.8B-Instruct \
2 --enable-lora \
3 --lora-modules ckpt=xxccho/EXAONE-GRPO-lg_convfin_mcq_grpo_ratio1.0_gen8_bs4_lr7e-6_beta0.04 \
4 --max-lora-rank 64 \
5 --trust-remote-code