Views
No views yet
1import torch
2from transformers import AutoModelForCausalLM, AutoTokenizer
3from peft import PeftModel
4
5device = "cuda:0" if torch.cuda.is_available() else "cpu"
6
7HF_TOKEN = "<YOUR_HF_TOKEN_GOES_HERE>"
8base_model_id = "meta-llama/Llama-3.2-3B-Instruct"
9peft_model_id = "garystafford/Llama-3.2-3B-Instruct-lora-nvidia-blackwell"
10
11base_model = AutoModelForCausalLM.from_pretrained(base_model_id, token=HF_TOKEN)
12model = PeftModel.from_pretrained(base_model, peft_model_id).to(device)
13tokenizer = AutoTokenizer.from_pretrained(base_model_id, token=HF_TOKEN)
14
15test_prompt = [
16 {
17 "role": "user",
18 "content": "Describe the NVIDIA Blackwell architecture.",
19 }
20]
21
22inputs = tokenizer.apply_chat_template(
23 test_prompt,
24 tokenize=True,
25 add_generation_prompt=True,
26 return_tensors="pt",
27).to(device)
28
29output = model.generate(
30 input_ids=inputs,
31 max_new_tokens=128,
32 temperature=0.1,
33 pad_token_id=tokenizer.pad_token_id,
34).to(device)
35
36output = tokenizer.decode(output[0], skip_special_tokens=True)
37output = output.split('assistant\n\n')[1].strip()
38print(output)1@misc{vonwerra2022trl,
2 title = {{TRL: Transformer Reinforcement Learning}},
3 author = {Leandro von Werra and Younes Belkada and Lewis Tunstall and Edward Beeching and Tristan Thrush and Nathan Lambert and Shengyi Huang and Kashif Rasul and Quentin Gallou{\'e}dec},
4 year = 2020,
5 journal = {GitHub repository},
6 publisher = {GitHub},
7 howpublished = {\url{https://github.com/huggingface/trl}}
8}