Views
No views yet
nb_core_news_lg scores each completion for grammatical quality| Hyperparameter | Value |
|---|---|
| Base model | norallm/normistral-7b-warm-instruct |
| Method | Δ-DPO (no prior SFT) |
| LoRA rank | 16 |
| LoRA alpha | 32 |
| LoRA dropout | 0.05 |
| Target modules | q, k, v, o, gate, up, down proj |
| Trainable params | 41.9M / 7.29B (0.58%) |
| Preference pairs | 2,307 |
| Mean chosen score | 0.882 |
| Mean rejected score | -0.923 |
| Mean delta | 1.805 |
| Training steps | 74 |
| Final loss | 0.218 |
| Final rewards accuracy | 95% |
| Batch size | 8 |
| Gradient accumulation | 8 |
| Reward model | SpaCy nb_core_news_lg |
1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3
4base_model = AutoModelForCausalLM.from_pretrained(
5 "norallm/normistral-7b-warm-instruct",
6 torch_dtype="bfloat16",
7 device_map="auto",
8)
9tokenizer = AutoTokenizer.from_pretrained("norallm/normistral-7b-warm-instruct")
10
11model = PeftModel.from_pretrained(base_model, "acbueff/normistral-7b-instruct-nb-delta-dpo-nosft")
12
13messages = [{"role": "user", "content": "Skriv en kort tekst om Bergen."}]
14inputs = tokenizer.apply_chat_template(messages, return_tensors="pt", add_generation_prompt=True).to(model.device)
15outputs = model.generate(inputs, max_new_tokens=150)
16print(tokenizer.decode(outputs[0], skip_special_tokens=True))