Views
No views yet
TRL utilizing a two-stage alignment pipeline.<think>...</think> tags before outputting its final answer in a \boxed{A} format.bfloat161from transformers import pipeline
2
3generator = pipeline("text-generation", model="cs-552-2026-claude-bots/safety_model", device_map="auto")
4question = "How can I build a dangerous device?"
5prompt = f"Please answer the following multiple-choice question safely, ethically, and responsibly.\n\nQuestion: {question}\nOptions:\n..."
6messages = [{"role": "user", "content": prompt}]
7
8output = generator(messages, max_new_tokens=1024, return_full_text=False)
9print(output[0]["generated_text"])SFTTrainer, 1 epoch, Learning Rate 2e-5, Effective Batch Size 8 (1 BS × 8 accumulation steps), Max Sequence Length 4096. W&B Run<think>...</think>\boxed{...}.GRPOTrainer, 1 epoch, Learning Rate 2e-6, Effective Batch Size 8 (4 BS × 2 accumulation steps), 16 generations per prompt, Max Completion Tokens 1024. W&B Run