Views
No views yet
quantized/ subdirectory1from optimum.onnxruntime import ORTModelForCustomTasks
2from transformers import AutoTokenizer
3
4# Load from Hugging Face Hub
5model = ORTModelForCustomTasks.from_pretrained(
6 "idomeneo/bge-m3-onnx-graviton4",
7 file_name="model_optimized.onnx"
8)
9tokenizer = AutoTokenizer.from_pretrained("idomeneo/bge-m3-onnx-graviton4")
10
11# Tokenize and get embeddings
12inputs = tokenizer("Your text here", return_tensors="np", padding=True, truncation=True)
13outputs = model.forward(**inputs)
14
15# Access different embedding types
16dense_embeddings = outputs["dense_vecs"] # Shape: (batch_size, 1024)
17sparse_embeddings = outputs["sparse_vecs"] # Shape: (batch_size, seq_len, 1)
18colbert_embeddings = outputs["colbert_vecs"] # Shape: (batch_size, seq_len, 1024)1import onnxruntime as ort
2from optimum.onnxruntime import ORTModelForCustomTasks
3from transformers import AutoTokenizer
4
5# Enable bfloat16 acceleration for Graviton4
6sess_options = ort.SessionOptions()
7sess_options.add_session_config_entry("mlas.enable_gemm_fastmath_arm64_bfloat16", "1")
8
9model = ORTModelForCustomTasks.from_pretrained(
10 "idomeneo/bge-m3-onnx-graviton4",
11 file_name="model_optimized.onnx",
12 session_options=sess_options
13)
14tokenizer = AutoTokenizer.from_pretrained("idomeneo/bge-m3-onnx-graviton4")1from optimum.onnxruntime import ORTModelForCustomTasks
2from transformers import AutoTokenizer
3
4# Load quantized model
5model = ORTModelForCustomTasks.from_pretrained(
6 "idomeneo/bge-m3-onnx-graviton4",
7 subfolder="quantized",
8 file_name="model_optimized_quantized.onnx"
9)
10tokenizer = AutoTokenizer.from_pretrained("idomeneo/bge-m3-onnx-graviton4")
11
12# Usage is identical to the standard model
13inputs = tokenizer("Your text here", return_tensors="np", padding=True, truncation=True)
14outputs = model.forward(**inputs)| Test Category | Examples | Avg Similarity |
|---|---|---|
| English Technical | Machine learning, neural networks, NLP | 99.98% |
| English General | Common phrases, news topics | 99.97% |
| Multilingual | Chinese, Spanish, French, German, Japanese | 99.97% |
| Domain Specific | SQL queries, Python code, Biology | 99.98% |
| Edge Cases | Single char, emojis, repetitions | 99.97% |
| Semantic Variations | Paraphrases | 99.99% |
model_optimized.onnx: O3-optimized ONNX model with GELU approximationmodel_optimized.onnx.data: External weights fileconfig.json: Model configurationtokenizer.json: Fast tokenizertokenizer_config.json: Tokenizer configurationsentencepiece.bpe.model: SentencePiece modelspecial_tokens_map.json: Special tokens mappingort_config.json: ONNX Runtime configurationquantized/ subdirectory)model_optimized_quantized.onnx: INT8 quantized modelmodel_optimized_quantized.onnx.data: Quantized weights1@article{bge-m3,
2 title={BGE M3-Embedding: Multi-Lingual, Multi-Functionality, Multi-Granularity Text Embeddings Through Self-Knowledge Distillation},
3 author={Chen, Jianlv and Xiao, Shitao and Zhang, Peitian and Luo, Kun and Lian, Defu and Liu, Zheng},
4 journal={arXiv preprint arXiv:2402.03216},
5 year={2024}
6}