Views
No views yet
attentions.{0..11} as additional outputs.1import onnxruntime as ort
2from transformers import AutoTokenizer
3import numpy as np
4
5# Load model and tokenizer
6session = ort.InferenceSession("model_quantized.onnx")
7tokenizer = AutoTokenizer.from_pretrained("naranor/DeBERTa-v3-small-ONNX-Attentions")
8
9# Prepare input
10inputs = tokenizer("Your text here", return_tensors="np")
11onnx_inputs = {
12 "input_ids": inputs["input_ids"],
13 "attention_mask": inputs["attention_mask"]
14}
15
16# Run with attentions
17outputs = session.run(None, onnx_inputs)
18# Last hidden state is outputs[0], attentions are in subsequent indices