Views
No views yet
see code dataset.
It achieves the following results on the evaluation set:1from datasets import load_dataset
2from datasets import interleave_datasets
3
4
5def format_chat_template(row):
6 for key in ['prompt', 'chosen', 'rejected']:
7 row[key] = tokenizer.apply_chat_template(row[key], tokenize=False)
8
9 return row
10
11
12dataset = (
13 interleave_datasets([
14 (
15 interleave_datasets(
16 load_dataset(
17 'four-two-labs/orpo-dpo-mix-40k-multilang-fixed',
18 token=hf_token,
19 )
20 .values()
21 )
22 .select_columns(['prompt', 'chosen', 'rejected'])
23 ),
24 (
25 load_dataset(
26 'four-two-labs/translations-5M-DPO',
27 split='train',
28 token=hf_token,
29 )
30 .shuffle(42)
31 .select(range(250_000))
32 .select_columns(['prompt', 'chosen', 'rejected'])
33 ),
34 (
35 load_dataset(
36 'four-two-labs/ultrafeedback_binarized-fixed',
37 split='train_prefs',
38 token=hf_token,
39 )
40 .select_columns(['prompt', 'chosen', 'rejected'])
41 ),
42 ])
43 .shuffle(seed=42)
44 #.select(range(1000))
45 .map(format_chat_template, num_proc=32)
46 .train_test_split(test_size=0.01)
47)| Training Loss | Epoch | Step | Validation Loss | Rewards/chosen | Rewards/rejected | Rewards/accuracies | Rewards/margins | Logps/rejected | Logps/chosen | Logits/rejected | Logits/chosen | Nll Loss | Log Odds Ratio | Log Odds Chosen |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1.1835 | 0.6001 | 2270 | 1.1764 | -0.1711 | -0.1684 | 0.4976 | -0.0027 | -1.6838 | -1.7106 | -2.6416 | -2.6430 | 1.0866 | -0.8991 | -0.1073 |
| 1.1494 | 1.2002 | 4540 | 1.1757 | -0.1709 | -0.1682 | 0.5003 | -0.0026 | -1.6820 | -1.7085 | -2.5529 | -2.5573 | 1.0860 | -0.8988 | -0.1070 |
| 1.233 | 1.8003 | 6810 | 1.1757 | -0.1709 | -0.1682 | 0.4993 | -0.0027 | -1.6819 | -1.7086 | -2.5859 | -2.5892 | 1.0859 | -0.8989 | -0.1073 |
| 1.2344 | 2.4004 | 9080 | 1.1757 | -0.1708 | -0.1682 | 0.5003 | -0.0027 | -1.6818 | -1.7085 | -2.6114 | -2.6139 | 1.0859 | -0.8989 | -0.1073 |