Views
No views yet
| Model | Parameters | Size (ONNX) | Acc@1 (Python) | Speed (CPU) |
|---|---|---|---|---|
| ALRI-Tiny | 24M | ~90 MB | 96.8% | ~35 ms |
| ALRI-Nano | 0.93M | ~6 MB | 94.0% | ~2 ms |
| MiniLM-L6 | 22M | ~80 MB | 92.0% | ~40 ms |
1import onnxruntime as ort
2from transformers import AutoTokenizer
3import numpy as np
4
5# Load Nano model
6session = ort.InferenceSession("alri-nano-onnx/model_int8.onnx")
7tokenizer = AutoTokenizer.from_pretrained("alri-nano-onnx/tokenizer")
8
9text = "how to read a json file in python"
10inputs = tokenizer(text, return_tensors="np")
11
12outputs = session.run(None, {
13 "input_ids": inputs["input_ids"].astype(np.int64),
14 "attention_mask": inputs["attention_mask"].astype(np.int64)
15})
16embedding = outputs[0] # (1, 128)