Views
No views yet
s-nlp/toolace-unified-hallucinations test split.| System | Span F1 | answer_mismatch | missing_tool | overgeneration |
|---|---|---|---|---|
| Published baseline | 0.9176 | 0.8432 | 0.9895 | 0.9373 |
| This ensemble | 0.9478 | 0.9237 | 0.9951 | 0.9426 |
answer_mismatch bottleneck improves 0.8432 → 0.9237 (+9.6% rel).| Member | Backbone / head | Span F1 | weight |
|---|---|---|---|
members/run_13 | ModernBERT-large, CE | 0.9350 | 1.5 |
members/run_20 | ModernBERT-large + AM3×, CE | 0.9407 | 1.5 |
members/run_27 | ModernBERT-large + AM3× (seed2), CE | 0.9387 | 1.5 |
members/run_22 | ModernBERT-base + linear-chain CRF | 0.9301 | 1.0 |
1python inference_ensemble.py \
2 --checkpoints members/run_13/final_model,members/run_20/final_model,members/run_27/final_model \
3 --crf_checkpoint members/run_22 \
4 --weights 1.5,1.5,1.5,1 --threshold 0.55 --min_span 2 --gap 0inference_ensemble.py accepts --input_json (a list of {system, conversations})
and emits predicted spans per item.answer_mismatch bottleneck.members/run_22 (CRF) uses a custom architecture loaded by CRFM in
inference_ensemble.py (final_model/crf_model.pt + encoder/).s-nlp/toolace-unified-hallucinations. Builds on the
s-nlp/tool-calling-hallucination-modernbert-base-unified-final baseline and
answerdotai/ModernBERT-large.