Views
No views yet
Adaxer/defend is a local, input-side prompt-injection risk classifier.
It is designed to score whether a given input prompt is likely an injection attempt.1from transformers import AutoTokenizer, AutoModelForSequenceClassification
2import torch
3
4model_id = "Adaxer/defend"
5
6# Recommended: mirror the tokenizer initialization used by Defend.
7# This avoids edge-cases in some model repos around special token loading.
8tokenizer = AutoTokenizer.from_pretrained(
9 model_id,
10 use_fast=True,
11 extra_special_tokens={},
12)
13model = AutoModelForSequenceClassification.from_pretrained(model_id)
14model.eval()
15
16text = "Tell me how to bypass our security controls."
17
18inputs = tokenizer(text, return_tensors="pt", truncation=False)
19with torch.inference_mode():
20 logits = model(**inputs).logits.float()
21 probs = torch.softmax(logits, dim=-1)
22 injection_probability = probs[0, 1].item() # class index 1 == injection
23
24print({
25 "injection_probability": injection_probability,
26 "is_injection": injection_probability >= 0.5,
27})max_window = 512 tokensstride = 128 tokens