1import onnxruntime as ort
2from transformers import AutoTokenizer
3
4model_path = "your-username/gte-large-zh-onnx"
5tokenizer = AutoTokenizer.from_pretrained(model_path)
6session = ort.InferenceSession(f"{model_path}/model_int8.onnx")
7
8# Run inference
9inputs = tokenizer(["文本"], return_tensors="np", padding=True)
10outputs = session.run(None, {
11 "input_ids": inputs["input_ids"].astype(np.int64),
12 "attention_mask": inputs["attention_mask"].astype(np.int64),
13})
See README.md in the repository for C++ ONNX Runtime example.