Views
No views yet
Status: work in progress: stable release expected mid June 2026. Currently only default nli models available
models/generate_onnx_model.py and optimized with Optimum.| Precision | Status | Notes |
|---|---|---|
| FP32 | available | CPU baseline, no optimization passes |
| FP16 | available | TensorRT EP / CUDA Tensor Core, level-1 or level-2 fused graph |
| INT8 | planned | quantized inference, coming mid June 2026 |
nli-base/
base/ # FP32, no optimization: CPU inference baseline
fp16/ # FP16 weights, no GPU-specific fusions
fp16_fused/ # FP16 + level-2 fusions: TensorRT EP / CUDA Tensor Coremodel.onnx alongside its tokenizer and config files, ready for use with ONNX Runtime.| Model | Architecture | Labels |
|---|---|---|
nli-minilm-onnx | RoBERTa (6L, hidden 768) | contradiction / entailment / neutral |
nli-deberta-v3-base | DeBERTa-v3 | contradiction / entailment / neutral |
bash scripts/download_models.sh1from optimum.onnxruntime import ORTModelForSequenceClassification
2from transformers import AutoTokenizer, pipeline
3
4model = ORTModelForSequenceClassification.from_pretrained(
5 "arsalan-anwari/zjudge",
6 subfolder="nli-base/fp16_fused/nli-minilm-onnx",
7)
8tokenizer = AutoTokenizer.from_pretrained(
9 "arsalan-anwari/zjudge",
10 subfolder="nli-base/fp16_fused/nli-minilm-onnx",
11)
12
13clf = pipeline("zero-shot-classification", model=model, tokenizer=tokenizer)
14clf("Amsterdam is the capital of the Netherlands.", candidate_labels=["geography", "sports"])1pip install -r models/requirements.txt
2
3# FP32 baseline
4python models/generate_onnx_model.py \
5 -m cross-encoder/nli-deberta-v3-base \
6 -o models/nli-base/base/nli-deberta-v3-base/
7
8# FP16 + fused (TensorRT / CUDA Tensor Core)
9python models/generate_onnx_model.py \
10 -m cross-encoder/nli-deberta-v3-base \
11 -o models/nli-base/fp16_fused/nli-deberta-v3-base/ \
12 --fp16 --optimization-level 1