Views
No views yet
SAFE vs. FLAGGED)0 → SAFE1 → FLAGGEDdistilbert-base-uncased| Metric | Score |
|---|---|
| Accuracy | 0.8050 |
| Precision | 0.7731 |
| Recall | 0.8846 |
| F1 Score | 0.8251 |
1from transformers import DistilBertTokenizerFast, DistilBertForSequenceClassification
2import torch
3
4# Load trained model and tokenizer
5model = DistilBertForSequenceClassification.from_pretrained("purrgpt-community/purrbert-v1")
6tokenizer = DistilBertTokenizerFast.from_pretrained("purrgpt-community/purrbert-v1")
7model.eval()
8
9def classify_prompt(prompt):
10 inputs = tokenizer(prompt, return_tensors="pt", truncation=True, padding=True)
11 with torch.no_grad():
12 outputs = model(**inputs)
13 pred = torch.argmax(outputs.logits, dim=-1).item()
14 return "SAFE" if pred == 0 else "FLAGGED"
15
16print(classify_prompt("You are worthless and nobody likes you!"))
17# → FLAGGED