Mistral-ORPO-ORPO-Capybara-7k is fine-tuned for 2.5 hours on four A100s exclusively on the 7k instances of the distilled Capybara paired multi-turn conversation dataset, argilla/distilabel-capybara-dpo-7k-binarized, by Argilla.
1from transformers import AutoModelForCausalLM, AutoTokenizer
2model = AutoModelForCausalLM.from_pretrained("kaist-ai/mistral-orpo-capybara-7k")3tokenizer = AutoTokenizer.from_pretrained("kaist-ai/mistral-orpo-capybara-7k")4# Apply chat template5query =[{'role':'user','content':'Hi! How are you doing?'}]6prompt = tokenizer.apply_chat_template(query, tokenize=False, add_generation_prompt=True)7inputs = tokenizer(prompt, return_tensors='pt')8# Generation with specific configurations9output = model.generate(10**inputs,11 max_new_tokens=128,12 do_sample=True,13 temperature=0.714)15response = tokenizer.batch_decode(output)16#<|user|>17#Hi! How are you doing?</s>18#<|assistant|>19#I'm doing well, thank you! How are you?</s>
📎 Citation
@misc{hong2024orpo,
title={ORPO: Monolithic Preference Optimization without Reference Model},
author={Jiwoo Hong and Noah Lee and James Thorne},
year={2024},
eprint={2403.07691},
archivePrefix={arXiv},
primaryClass={cs.CL}
}