Beta
Explore
Marketplace
Neural Labs
Chat
Wallet
Docs
Qwen-7B-chat-sudoku-grpo-steps500 – AI Model by Oliver1515 | AlphaNeural AI
You can deploy this model and start earning money today!
Oliver1515
/
Qwen-7B-chat-sudoku-grpo-steps500
like
0
safetensors
qwen2
mit
us
Views
No views yet
Model card
Files and Versions
Community
API
Deploy
用GRPO实现一个简单的数独游戏。
本次实验我们使用GRPO的方法,用lora来做微调,框架选择trl,我们对比了7B模型的训练效果,并且通过不断地调整参数实现最终准确度达到86%。