Views
No views yet
| v3 | v1 | |
|---|---|---|
| Base Model | bert-base-multilingual-cased | nlpaueb/legal-bert-small-uncased |
| Base Tokenizer | bert-base-multilingual-cased | bert-base-multilingual-cased |
| Framework | PyTorch | TensorFlow |
| Dataset Size | 3.0M | 2.68M |
| Train Split | 80% English 20% English + 100% Multilingual | None |
| English Train Accuracy | 99.5% | N/A (≈97.5%) |
| Other Train Accuracy | 98.6% | 96.6% |
| Final Val Accuracy | 96.8% | 94.6% |
| Languages | 55 | N/A (≈35) |
| Hyperparameters | maxlen=208 padding='max_length' batch_size=112 optimizer=AdamW learning_rate=1e-5 loss=BCEWithLogitsLoss() | maxlen=192 padding='max_length' batch_size=16 optimizer=Adam learning_rate=1e-5 loss="binary_crossentropy" |
| Training Stopped | 7/20/2023 | 9/05/2022 |
1text = "hello world!"
2
3import torch
4from transformers import AutoTokenizer, AutoModelForSequenceClassification
5
6device = torch.device("cuda" if torch.cuda.is_available() else "cpu")
7tokenizer = AutoTokenizer.from_pretrained("FredZhang7/one-for-all-toxicity-v3")
8model = AutoModelForSequenceClassification.from_pretrained("FredZhang7/one-for-all-toxicity-v3").to(device)
9
10encoding = tokenizer.encode_plus(
11 text,
12 add_special_tokens=True,
13 max_length=208,
14 padding="max_length",
15 truncation=True,
16 return_tensors="pt"
17)
18print('device:', device)
19input_ids = encoding["input_ids"].to(device)
20attention_mask = encoding["attention_mask"].to(device)
21
22with torch.no_grad():
23 outputs = model(input_ids, attention_mask=attention_mask)
24 logits = outputs.logits
25 predicted_labels = torch.argmax(logits, dim=1)
26
27print(predicted_labels)