Views
No views yet
| Metric | PyTorch (T4 GPU) | ONNX INT8 (Ryzen 5 CPU) |
|---|---|---|
| Overall F1 | 0.9916 | 0.9916 |
| Latency p50 | 7.35ms | 57.29ms |
| Latency p95 | 7.97ms | 96.38ms |
| Within 150ms target | ✓ | ✓ |
PERSON, EMAIL, PHONE_NUMBER, ADDRESS, ACCOUNT_NUMBER, BANK_ACCOUNT_NUMBER, IBAN1from optimum.onnxruntime import ORTModelForTokenClassification
2from transformers import AutoTokenizer
3
4model = ORTModelForTokenClassification.from_pretrained("C-Ilyas/arabic-pii-detector-onnx")
5tokenizer = AutoTokenizer.from_pretrained("C-Ilyas/arabic-pii-detector-onnx")scripts/infer_onnx.py in the project repository.1python scripts/optimize_onnx.py \
2 --model models/arabic-pii-detector \
3 --output models/arabic-pii-detector-onnxAutoQuantizationConfig.avx2(is_static=False, per_channel=False) — dynamic INT8 quantization with AVX2 kernels.