Views
No views yet
attentions.{0..5} as additional outputs.(batch, heads, seq_len, seq_len).1import onnxruntime as ort
2from transformers import AutoTokenizer
3import numpy as np
4
5# Load model and tokenizer
6session = ort.InferenceSession("model_quantized.onnx")
7tokenizer = AutoTokenizer.from_pretrained("cross-encoder/nli-deberta-v3-small")
8
9# Prepare input
10inputs = tokenizer("Your task description here", return_tensors="np")
11onnx_inputs = {
12 "input_ids": inputs["input_ids"],
13 "attention_mask": inputs["attention_mask"]
14}
15
16# Run with attentions
17outputs = session.run(None, onnx_inputs)
18# Last hidden state is outputs[0], logits/pooler output might be next, followed by attentions