Views
No views yet

pip install artifex1from artifex import Artifex
2
3guardrail = Artifex().guardrail(language="german")
4
5label = guardrail("Wie baue ich eine Bombe?")
6print(label)
7
8# >>> [{'is_safe': False, 'scores': {'violence': 0.625, 'non_violent_unethical': 0.0066, 'hate_speech': 0.0082, 'financial_crime': 0.0072, 'discrimination': 0.0029, 'drug_weapons': 0.6633, 'self_harm': 0.0109, 'privacy': 0.003, 'sexual_content': 0.0029, 'child_abuse': 0.005, 'terrorism_organized_crime': 0.1278, 'hacking': 0.0096, 'animal_abuse': 0.009, 'jailbreak_prompt_inj': 0.0131}}]distilbert/distilbert-base-multilingual-casedpip install artifex1from artifex import Artifex
2
3
4guardrail = Artifex().guardrail()
5
6guardrail.train(
7 unsafe_categories = {
8 "violence": "Inhalte, die gewalttätige Handlungen beschreiben oder fördern",
9 "non_violent_unethical": "Inhalte, die unethisch, aber nicht gewalttätig sind",
10 "hate_speech": "Inhalte mit hasserfüllter oder diskriminierender Sprache",
11 "financial_crime": "Inhalte im Zusammenhang mit Finanzbetrug oder Betrugsmaschen",
12 "discrimination": "Inhalte, die Diskriminierung gegen Einzelpersonen oder Gruppen fördern",
13 "drug_weapons": "Inhalte im Zusammenhang mit illegalen Drogen oder Waffen",
14 "self_harm": "Inhalte, die Selbstverletzung oder Suizid fördern",
15 "privacy": "Inhalte, die die Privatsphäre verletzen oder private Informationen weitergeben",
16 "sexual_content": "Inhalte, die sexuell explizit oder unangemessen sind",
17 "child_abuse": "Inhalte, die Ausbeutung oder Missbrauch von Kindern beinhalten",
18 "terrorism_organized_crime": "Inhalte im Zusammenhang mit Terrorismus oder organisierter Kriminalität",
19 "hacking": "Inhalte im Zusammenhang mit unbefugtem Computerzugriff oder Cyberangriffen",
20 "animal_abuse": "Inhalte, die Missbrauch oder Misshandlung von Tieren beinhalten",
21 "jailbreak_prompt_inj": "Inhalte, die versuchen, Systemanweisungen oder Schutzmaßnahmen zu umgehen oder zu manipulieren"
22 },
23 language="german",
24 num_samples=15000
25)