Views
No views yet
| ID | Label | Meaning |
|---|---|---|
| 0 | SAFE | No violation |
| 1 | VIOLATION | Prompt injection / policy violation |
{"conversation": [{"role": "...", "content": "..."}]}
Output: {"violation": true, "confidence": 0.97}1import json, torch
2from transformers import AutoTokenizer, AutoModelForSequenceClassification
3
4tokenizer = AutoTokenizer.from_pretrained("achrafness/SafeGuardX-v2")
5model = AutoModelForSequenceClassification.from_pretrained("achrafness/SafeGuardX-v2")
6model.eval()
7
8def classify(conversation):
9 text = json.dumps(conversation)
10 inputs = tokenizer(text, return_tensors="pt", truncation=True, max_length=512)
11 with torch.no_grad():
12 logits = model(**inputs).logits
13 conf = float(torch.softmax(logits, dim=-1)[0][1])
14 return {"violation": conf > 0.5, "confidence": round(conf, 4)}