dpo_gsm8k_olmo-3-7b_as_llama-3.1-8b_seed42
Dementor imitation (disguise) LoRA adapter — dataset gsm8k, seed 42.
- Method: DPO
- Source model (fine-tuned / disguised):
olmo-3-7b (base: allenai/OLMo-3-7B-Instruct)
- Target model being imitated:
llama-3.1-8b
- Dataset: gsm8k | Seed: 42
This adapter trains the source model to imitate the target model's style on the
gsm8k corpus. Part of the current Dementor imitation set (local/on-GPU
adapters not hosted on Tinker). Registry key == repo id == dpo_gsm8k_olmo-3-7b_as_llama-3.1-8b_seed42.