The full PyTorch checkpoint is at
WSHAPER/distilbert-multilingual-dialogue-act-classifier. The optimization pipeline is on
GitHub.
1import numpy as np
2import onnxruntime as ort
3from transformers import AutoTokenizer
4
5tokenizer = AutoTokenizer.from_pretrained("WSHAPER/dialogue-act-classifier-fp16-multilingual")
6session = ort.InferenceSession("model.onnx", providers=["CUDAExecutionProvider"])
7
8text = "Können Sie mir den Bericht schicken?" # or any EN/DE/RU text
9inputs = tokenizer(text, padding="max_length", truncation=True, max_length=48, return_tensors="np")
10outputs = session.run(None, {
11 "input_ids": inputs["input_ids"].astype(np.int64),
12 "attention_mask": inputs["attention_mask"].astype(np.int64),
13})
14
15label_names = ["commissive", "directive", "inform", "question"]
16probs = np.exp(outputs[0][0]) / np.exp(outputs[0][0]).sum()
17pred = label_names[np.argmax(probs)]
18print(f"Prediction: {pred} (confidence: {probs.max():.2f})")