Beta
Explore
Marketplace
Neural Labs
Chat
Wallet
Docs
eval-Hermes-4-14B-reasoning-old – Dataset by NousResearch | AlphaNeural AI
You can deploy this model and start earning money today!
NousResearch
/
eval-Hermes-4-14B-reasoning-old
like
0
en
100K<n<1M
tabular
text
us
evaluation
benchmarks
Views
No views yet
Model card
Files and Versions
Community
API
h4-e3-overlong-masked-30k-rerun Evaluation Results Summary
Benchmark Score Metric Samples Overlong rate
aime24 0.527 math_pass@1:64_samples 64 6.6%
aime25 0.414 math_pass@1:64_samples 64 8.1%
arenahard 0.782 eval/overall_winrate 500 0.0%
bbh_generative 0.844 extractive_match 1 5.8%
creative-writing-v3 0.617 creative_writing_score 96 0.0%
drop_generative_nous 0.827 drop_acc 1 2.4%
eqbench3 0.805 eqbench_score 135 0.0%
gpqa_diamond 0.556… See the full description on the dataset page:
https://huggingface.co/datasets/NousResearch/eval-Hermes-4-14B-reasoning-old
.