Views
No views yet
1import onnxruntime as ort
2from transformers import AutoTokenizer
3
4tokenizer = AutoTokenizer.from_pretrained("你的用户名/Qwen3-Embedding-0.6B-Int8-ONNX")
5session = ort.InferenceSession("Qwen3-Embedding-0.6B.int8.onnx")
6
7text = "这是一个测试句子"
8inputs = tokenizer(text, return_tensors="np")
9outputs = session.run(None, dict(inputs))
10embedding = outputs[0] # 通常是 last_hidden_state 或 pooler_output