Safe-o1 is an innovative language model that introduces a self-monitoring thinking process to detect and filter unsafe content, achieving more robust safety performance 🚀.Safe-o1 performs more stably in complex scenarios, reducing unexpected "derailments."
Safe-o1 using the Hugging Face transformers library:1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3tokenizer = AutoTokenizer.from_pretrained("PKU-Alignment/Safe-o1")
4model = AutoModelForCausalLM.from_pretrained("PKU-Alignment/Safe-o1")
5
6input_text = "Hello, World!"
7inputs = tokenizer(input_text, return_tensors="pt")
8outputs = model.generate(**inputs)
9print(tokenizer.decode(outputs[0], skip_special_tokens=True))
10