Views
No views yet
broadfield-dev/bert-small-ner-pii-tuned-12261022token-classification17INT8 - Optimized for Mobile (ARM64)onnxruntime and tokenizers.pip install onnxruntime tokenizers1
2from tokenizers import Tokenizer
3import onnxruntime as ort
4import numpy as np
5
6# 1. Load the lightweight tokenizer (No Transformers dependency needed)
7tokenizer = Tokenizer.from_pretrained("broadfield-dev/bert-small-ner-pii-tuned-12261022-onnx")
8
9# 2. Load the ONNX model
10session = ort.InferenceSession("model.onnx")
11
12# 3. Preprocess (Simple text encoding)
13text = "Run inference on mobile!"
14encoding = tokenizer.encode(text)
15
16# Prepare inputs (Exact names vary by model, usually input_ids + attention_mask)
17inputs = {
18 "input_ids": np.array([encoding.ids], dtype=np.int64),
19 "attention_mask": np.array([encoding.attention_mask], dtype=np.int64)
20}
21
22# 4. Run Inference
23outputs = session.run(None, inputs)
24print("Output logits shape:", outputs[0].shape)
25INT8 - Optimized for Mobile (ARM64) quantization settings and a pre-compiled tokenizer.json for fast loading.