Beta
Explore
Marketplace
Neural Labs
Chat
Wallet
Docs
llama-3-8b-elyza-ja-werewolf – AI Model by tokennext | AlphaNeural AI
You can deploy this model and start earning money today!
tokennext
/
llama-3-8b-elyza-ja-werewolf
like
0
transformers
safetensors
llama
text-generation
conversational
ja
llama3
autotrain_compatible
text-generation-inference
endpoints_compatible
us
Views
No views yet
Model card
Files and Versions
Community
API
Deploy
🔧 DPO(人狼ゲーム用)
このモデルは、オリジナルの
elyza/Llama-3-ELYZA-JP-8B
をベースに、人狼ゲームのセリフ生成タスク向けに
DPO(Direct Preference Optimization)
を用いて学習を施したものです。
学習目的
人狼ゲームにおける「取り乱す村人」や「しらを切る人狼」、「情けない行動」など、特定の感情表現を伴うセリフを高品質に生成できるようにすることを目的としました。
データについて
データ数は少数(百数ペア)であり、ハッカソン形式で迅速に作成されたものです。
使用手法
DPO (Direct Preference Optimization)
LoRAなどの軽量手法と併用
トレーニングには
trl
ライブラリを使用
注意点
データ量が少ないため、本モデルはあくまで試験的なモデルです。