Views
No views yet
1import torch
2from huggingface_hub import snapshot_download
3from unsloth import FastLanguageModel, PatchFastRL
4PatchFastRL("GRPO", FastLanguageModel)1max_seq_length = 512
2lora_rank = 32
3
4model, tokenizer = FastLanguageModel.from_pretrained(
5 model_name = "meta-llama/meta-Llama-3.1-8B-Instruct",
6 max_seq_length = max_seq_length,
7 load_in_4bit = True,
8 fast_inference = True,
9 max_lora_rank = lora_rank,
10 gpu_memory_utilization = 0.6,
11)1SYSTEM_PROMPT = """
2Respond in the following format:
3<reasoning>
4...
5</reasoning>
6<answer>
7...
8</answer>
9"""1model_id = "nirusanan/GRPO-llama3.1-reasoning"
2
3snapshot_download(repo_id=model_id, local_dir="llama-grpo_saved_lora",
4 local_dir_use_symlinks=False, revision="main")model.load_adapter("/content/llama-grpo_saved_lora")1text = tokenizer.apply_chat_template([
2 {"role" : "system", "content" : SYSTEM_PROMPT},
3 {"role" : "user", "content" : "Calculate pi."},
4], tokenize = False, add_generation_prompt = True)
5
6from vllm import SamplingParams
7sampling_params = SamplingParams(
8 temperature = 0.8,
9 top_p = 0.95,
10 max_tokens = 1024,
11)
12output = model.fast_generate(
13 text,
14 sampling_params = sampling_params,
15)[0].outputs[0].text
16
17output