Beta
Explore
Marketplace
Neural Labs
Chat
Wallet
Docs
TCMConverse-4B-SFT-PPO-MultiReward-Alignment – AI Model by cduoduo | AlphaNeural AI
You can deploy this model and start earning money today!
cduoduo
/
TCMConverse-4B-SFT-PPO-MultiReward-Alignment
like
0
apache-2.0
us
Views
No views yet
Model card
Files and Versions
Community
API
Deploy
基于cduoduo/TCMConverse-4B-SFT和多个奖励模型,使用PPO算法应用优化后的奖励函数进行偏好对齐后的模型。
使模型具备了更强的中医咨询能力。
任何问题请联系邮箱:
longfeichai@stu.haust.edu.cn