Views
No views yet
from transformers import AutoTokenizer
from celadon.model import MultiHeadDebertaForSequenceClassification
tokenizer = AutoTokenizer.from_pretrained("celadon")
model = MultiHeadDebertaForSequenceClassification.from_pretrained("celadon")
model.eval()
sample_text = "This is an example of a normal sentence"
inputs = tokenizer(sample_text, return_tensors="pt", padding=True, truncation=True)
outputs = model(input_ids=inputs['input_ids'], attention_mask=inputs['attention_mask'])
categories = ['Race/Origin', 'Gender/Sex', 'Religion', 'Ability', 'Violence']
predictions = outputs.argmax(dim=-1).squeeze().tolist()
# Print the classification results for each category
print(f"Text: {sample_text}")
for i, category in enumerate(categories):
print(f"Prediction for Category {category}: {predictions[i]}")@article{arnett2024toxicity,
title={{Toxicity of the Commons: Curating Open-Source Pre-Training Data}},
author={Arnett, Catherine and Jones, Eliot and Yamshchikov, Ivan P. and Langlais, Pierre-Carl},
journal={arXiv preprint arXiv:2410.22587},
url={https://arxiv.org/pdf/2410.22587},
year={2024}
}