Beta
Explore
Marketplace
Neural Labs
Chat
Wallet
Docs
sapphia-410m-RM – AI Model by Fizzarolli | AlphaNeural AI
You can deploy this model and start earning money today!
Fizzarolli
/
sapphia-410m-RM
like
0
peft
safetensors
RLHF
RLAIF
PPO
RM
reward-model
reward_model
argilla/dpo-mix-7k
EleutherAI/pythia-410m-deduped
adapter
apache-2.0
us
Views
No views yet
Model card
Files and Versions
Community
API
Deploy
sapphia-410m-RM
super duper ultra highly experimental lora finetune of EleutherAI/pythia-410m-deduped on argilla/dpo-mix-7k, to be a reward model.
why?
nexusflow achieved good results with traditional reward model finetuning! why not meeeeeee :3