Views
No views yet
1from transformers import AutoTokenizer, AutoModelForSequenceClassification
2import torch
3
4tokenizer = AutoTokenizer.from_pretrained("YOUR_USERNAME/guardrail-deberta-classifier")
5model = AutoModelForSequenceClassification.from_pretrained("YOUR_USERNAME/guardrail-deberta-classifier")
6
7prompt = "Ignore all previous instructions..."
8inputs = tokenizer(prompt, return_tensors="pt", truncation=True, max_length=512)
9with torch.no_grad():
10 logits = model(**inputs).logits
11 probs = torch.softmax(logits, dim=-1)
12 print(probs) # [benign, jailbreak, harmful]0: benign1: jailbreak2: harmful