Views
No views yet
| Stage | Llama 3.1 8B |
|---|---|
| Base Model | meta-llama/llama-3.1-8B-Instruct |
| SFT_initial | pm-25/llama3-8b-sft-initial |
| SFT_final | pm-25/llama3-8b-sft |
| DPO | pm-25/llama3-8b-dpo_clean |
| SFT + DPO | pm-25/llama3-8b-sft-dpo |
| SFT + DPO_tulu_data_only | pm-25/llama3-8b-sft-dpo-tulu-only |
| GRPO | pm-25/llama3-8b-grpo |
| SFT + GRPO | pm-25/llama3-8b-sft-grpo |
from transformers import AutoModelForCausalLM
from peft import PeftModel
model = AutoModelForCausalLM.from_pretrained("meta-llama/Llama-3.1-8B-Instruct")
model = PeftModel.from_pretrained(model, "pm-25/llama3-8b-dpo_clean")playpen eval <model-name>1{
2"model_name": "llama3-8b-sft-dpo_clean",
3"backend": "huggingface_local",
4"huggingface_id": "pm-25/llama3-8b-sft-dpo_clean",
5"release_date": "2025-08-22",
6"open_weight": true,
7"parameters": "8B",
8"languages": ["en", "de", "fr", "it", "pt", "hi", "es", "th"],
9"context_size": "128k",
10"license": {
11"name": "Meta",
12"url": "https://github.com/meta-llama/llama-models/blob/main/models/llama3_1/LICENSE"
13},
14"model_config": {
15 "peft_model": "pm-25/llama3-8b-dpo_clean",
16 "requires_api_key": true,
17 "premade_chat_template": true,
18 "eos_to_cull": "<\|eot_id\|>"
19 }
20}| Model | ClemScore | StatScore |
|---|---|---|
| Llama-3-8b-sft | 42.68 | 53.25 |
| Llama-3-8b-sft-initial | 33.86 | 55.62 |
| Llama-3-8b-grpo | 32.82 | 57.86 |
| Llama-3.1-8B-Instruct (base) | 29.05 | 55.45 |
| Llama-3-8b-sft-dpo | 28.32 | 55.58 |
| Llama-3-8b-sft-grpo | 26.68 | 57.74 |
| Llama-3-8b-sft-dpo_tulu_only | 23.68 | 58.04 |
| Llama-3-8b-dpo_clean | 17.57 | 52.83 |
| Tulu3-8b-SFT | 4.77 | 55.51 |
| Tulu3-8b-DPO | 3.66 | 56.16 |
| Tulu3-8b | 2.41 | 57.43 |
lm_head, embed_tokens