Beta
Explore
Marketplace
Neural Labs
Chat
Wallet
Docs
LLM2026_DPO_SFT19_v2 – AI Model by makotonlo | AlphaNeural AI
You can deploy this model and start earning money today!
makotonlo
/
LLM2026_DPO_SFT19_v2
like
0
transformers
safetensors
dpo
unsloth
qwen
alignment
text-generation
conversational
en
u-10bei/dpo-dataset-qwen-cot
makotonlo/LLM2026_SFT_finalv19_7B
finetune
apache-2.0
endpoints_compatible
us
Views
No views yet
Model card
Files and Versions
Community
API
Deploy
LLM2026_DPO_SFT19_v2
This model is a fine-tuned LoRA adapter of
makotonlo/LLM2026_SFT_finalv19_7B
using
Direct Preference Optimization (DPO)
.
Training Configuration
Base SFT Model
: makotonlo/LLM2026_SFT_finalv19_7B
Method
: DPO
Epochs
: 1
Learning rate
: 1e-06
Beta
: 0.1
Max sequence length
: 1024
Usage
Load via the evaluation script's
adapter_merge
mode.