Views
No views yet
| Task | Output | Notes |
|---|---|---|
| Dialogue act | 21-class label | Classifies player utterance type |
| Manipulation detection | Binary probability | Detects prompt injection / NPC takeover attempts |
accusation, acknowledgment, action, agree, command, conditional, confession, disagree, emote, farewell, flirt, greeting, hedge, hostile, intent, offer, opinion, out_of_character, question, statement, yes_no_questiononnxruntime)1import json
2import numpy as np
3import onnxruntime
4from huggingface_hub import snapshot_download
5from transformers import AutoTokenizer
6
7snapshot_download(repo_id="myemfar/distilbert-multitask", local_dir="./distilbert_multitask")
8
9session = onnxruntime.InferenceSession("./distilbert_multitask/model.onnx")
10tokenizer = AutoTokenizer.from_pretrained("./distilbert_multitask")
11
12with open("./distilbert_multitask/label_map_da.json") as f:
13 labels = {int(k): v for k, v in json.load(f).items()}
14
15inputs = tokenizer("Where is the tavern?", return_tensors="np")
16logits_da, logits_manip = session.run(None, dict(inputs))
17
18da_label = labels[int(np.argmax(logits_da))] # "question"
19manip_prob = float(1 / (1 + np.exp(-logits_manip[0][0]))) # sigmoid| Dataset | License | Description |
|---|---|---|
| deepset/prompt-injections | CC BY 4.0 | Benign queries + prompt injection examples |
| hackaprompt/hackaprompt-dataset | Apache 2.0 | Red-teaming competition submissions |
| lakera-ai/gandalf_ignore_instructions | CC BY 4.0 | Instruction-override attempts from Lakera's Gandalf challenge |