Views
No views yet
1from transformers import RobertaForSequenceClassification, RobertaTokenizer
2safety_classifier_dir = 'zjunlp/SafeEdit-Safety-Classifier'
3safety_classifier_model = RobertaForSequenceClassification.from_pretrained(safety_classifier_dir)
4safety_classifier_tokenizer = RobertaTokenizer.from_pretrained(safety_classifier_dir)1@misc{wang2024SafeEdit,
2 title={Detoxifying Large Language Models via Knowledge Editing},
3 author={Mengru Wang, Ningyu Zhang, Ziwen Xu, Zekun Xi, Shumin Deng, Yunzhi Yao, Qishen Zhang, Linyi Yang, Jindong Wang, Huajun Chen},
4 year={2024},
5 eprint={2403.14472},
6 archivePrefix={arXiv},
7 primaryClass={cs.CL}
8 url={https://arxiv.org/abs/2403.14472},
9
10}