Beta
Explore
Marketplace
Neural Labs
Chat
Wallet
Docs
heuristic-reward-checkpoint – AI Model by envsetup-rl-dl4c | AlphaNeural AI
You can deploy this model and start earning money today!
envsetup-rl-dl4c
/
heuristic-reward-checkpoint
like
0
transformers
safetensors
qwen3
text-generation
conversational
Qwen/Qwen3-8B
finetune
apache-2.0
autotrain_compatible
text-generation-inference
endpoints_compatible
us
Views
No views yet
Model card
Files and Versions
Community
API
Deploy
Reinforcement Fine-Tuned Qwen3-8B
This model is fine-tuned on the Qwen3-8B model using reinforcement learning for environment setup task. It's trained on zeroshot prompts from the
EnvBench
dataset.