Dieser Datensatz wurde vom Belkis Aslani entwickelt. Er enthält eine Sammlung von kritischen, schädlichen oder illegalen Instruktionen (Prompts) in deutscher Sprache, gepaart mit ethisch korrekten und sicheren Ablehnungen ("Refusals").
Gesamtanzahl: 1.032 Einträge
Der Datensatz dient dazu, deutschsprachige KI-Modelle sicherer zu machen (Safety Alignment), indem ihnen beigebracht wird, auf schädliche Anfragen angemessen und ablehnend zu reagieren.… See the full description on the dataset page:
https://huggingface.co/datasets/Beko2210/K-Ai_German_Refusal.