Views
No views yet
causaltext-generationINT8 (ARM64)171
2from tokenizers import Tokenizer
3import onnxruntime as ort
4import numpy as np
5
6# 1. Load Tokenizer
7tokenizer = Tokenizer.from_pretrained("broadfield-dev/Qwen3-0.6B-20260105-060935-onnx")
8
9# 2. Load Model
10session = ort.InferenceSession("model.onnx")
11
12# 3. Inference
13text = "Hello world"
14encoding = tokenizer.encode(text)
15inputs = {
16 "input_ids": np.array([encoding.ids], dtype=np.int64),
17 "attention_mask": np.array([encoding.attention_mask], dtype=np.int64)
18}
19
20outputs = session.run(None, inputs)
21print(f"Output shape: {outputs[0].shape}")
22