Views
No views yet
jackhhao/jailbreak-classification
for the evaluation (train+test)| Model | Accuracy | Precision | Recall | F1 Score | AUC-ROC |
|---|---|---|---|---|---|
| Llama-Prompt-Guard-2-22M | 0.9564 | 0.9888 | 0.9249 | 0.9558 | 0.9234 |
| Llama-Prompt-Guard-2-22M-q | 0.9579 | 0.9967 | 0.9204 | 0.9449 | 0.9180 |
| Llama-Prompt-Guard-2-86M | 0.9801 | 0.9984 | 0.9625 | 0.9801 | 0.9519 |
| Llama-Prompt-Guard-2-86M-q | 0.8989 | 1.0000 | 0.8018 | 0.89 | 0.7452 |
1from transformers import AutoTokenizer
2from optimum.onnxruntime import ORTModelForSequenceClassification
3import numpy as np
4
5# Load model and tokenizer using optimum
6model = ORTModelForSequenceClassification.from_pretrained("gravitee-io/Llama-Prompt-Guard-2-22M-onnx", file_name="model.quant.onnx")
7tokenizer = AutoTokenizer.from_pretrained("gravitee-io/Llama-Prompt-Guard-2-22M-onnx")
8
9# Tokenize input
10text = "Your comment here"
11inputs = tokenizer(text, return_tensors="pt", padding=True, truncation=True)
12
13# Run inference
14outputs = model(**inputs)
15logits = outputs.logits
16
17# Optional: convert to probabilities
18probs = 1 / (1 + np.exp(-logits))
19print(probs)