Views
No views yet
deepvk/USER-bge-m3.| Property | Value |
|---|---|
| Base model | deepvk/USER-bge-m3, BAAI/bge-m3 |
| Quantization | INT8 (Dynamic) |
| Format | ONNX |
| Libraries | transformers, onnxruntime, optimum, sentence-transformers |
| Embedding dim | 1024 |
| Supported HW | CPU (optimized for Intel AVX512-VNNI, fallback to AVX2) |
| License | Apache-2.0 |
| Metric | Value |
|---|---|
| Avg cosine similarity (vs FP32) | ~0.988 |
| Median cosine similarity | ~0.988 |
| Orig model time (s) | 0.7504 |
| Quant model time (s) | 0.3539 |
| Inference speed | ~2× faster |
| Model size (MB) | 347.5 |
deepvk/USER-bge-m3skatzR/USER-BGE-M3-ONNX-INT8examples folder:quantmodel.py — universal Python module for loading and encoding texts with the quantized ONNX model.app-console.py — console script to compare FP32 vs INT8 embeddings (cosine similarity + inference time).app-streamlit.py — interactive demo with Streamlit.