Views
No views yet
text-generationINT8 (ARM64)181
2from tokenizers import Tokenizer
3import onnxruntime as ort
4import numpy as np
5# 1. Load Tokenizer
6tokenizer = Tokenizer.from_pretrained("broadfield-dev/Qwen3-0.6B-20260105-055554-onnx")
7# 2. Load Model
8session = ort.InferenceSession("model.onnx")
9# 3. Inference
10text = "Hello world"
11encoding = tokenizer.encode(text)
12inputs = {
13 "input_ids": np.array([encoding.ids], dtype=np.int64),
14 "attention_mask": np.array([encoding.attention_mask], dtype=np.int64)
15}
16logits = session.run(None, inputs)[0]
17print(logits.shape)
18