Beta
Explore
Marketplace
Neural Labs
Chat
Wallet
Docs
qgallouedec_-_online-dpo-qwen2-3-awq – AI Model by RichardErkhov | AlphaNeural AI
You can deploy this model and start earning money today!
RichardErkhov
/
qgallouedec_-_online-dpo-qwen2-3-awq
like
0
safetensors
qwen2
4-bit
awq
us
Views
No views yet
Model card
Files and Versions
Community
API
Deploy
Quantization made by Richard Erkhov.
Github
Discord
Request more models
online-dpo-qwen2-3 - AWQ
Model creator:
https://huggingface.co/qgallouedec/
Original model:
https://huggingface.co/qgallouedec/online-dpo-qwen2-3/
Original model description:
base_model: Qwen/Qwen2-0.5B-Instruct datasets: dataset_name library_name: transformers model_name: online-dpo-qwen2-3 tags:
trl
online-dpo
generated_from_trainer licence: license
Model Card for online-dpo-qwen2-3
This model is a fine-tuned version of
Qwen/Qwen2-0.5B-Instruct
on the
https://huggingface.co/datasets/trl-lib/ultrafeedback-prompt
dataset.