Views
No views yet
BertTokenizerFast with special tokens for [UNK], [CLS], [SEP], [PAD], [MASK]| Script | Support | Precision | Recall | F1 Score | Size |
|---|---|---|---|---|---|
| Arab | 819219 | 0.9038 | 0.9014 | 0.9023 | 21 |
| Latn | 7924704 | 0.9678 | 0.9663 | 0.9670 | 125 |
| Ethi | 144403 | 0.9967 | 0.9964 | 0.9966 | 2 |
| Beng | 163983 | 0.9949 | 0.9935 | 0.9942 | 3 |
| Deva | 423895 | 0.9495 | 0.9326 | 0.9405 | 10 |
| Cyrl | 831949 | 0.9899 | 0.9883 | 0.9891 | 12 |
| Tibt | 35683 | 0.9925 | 0.9930 | 0.9927 | 2 |
| Grek | 131155 | 0.9984 | 0.9990 | 0.9987 | 1 |
| Gujr | 86912 | 0.99999 | 0.9999 | 0.99995 | 1 |
| Hebr | 100530 | 0.9966 | 0.9995 | 0.9981 | 2 |
| Armn | 67203 | 0.9999 | 0.9998 | 0.9998 | 1 |
| Jpan | 88004 | 0.9983 | 0.9987 | 0.9985 | 1 |
| Knda | 67170 | 0.9999 | 0.9998 | 0.9999 | 1 |
| Geor | 70769 | 0.99997 | 0.9998 | 0.9999 | 1 |
| Khmr | 39708 | 1.0000 | 0.9997 | 0.9999 | 1 |
| Hang | 108509 | 0.9997 | 0.9999 | 0.9998 | 1 |
| Laoo | 29389 | 0.9999 | 0.9999 | 0.9999 | 1 |
| Mlym | 68418 | 0.99996 | 0.9999 | 0.9999 | 1 |
| Mymr | 100857 | 0.9999 | 0.9992 | 0.9995 | 2 |
| Orya | 44976 | 0.9995 | 0.9998 | 0.9996 | 1 |
| Guru | 67106 | 0.99999 | 0.9999 | 0.9999 | 1 |
| Olck | 22279 | 1.0000 | 0.9991 | 0.9995 | 1 |
| Sinh | 67492 | 1.0000 | 0.9998 | 0.9999 | 1 |
| Taml | 76373 | 0.99997 | 0.9999 | 0.9999 | 1 |
| Tfng | 41325 | 0.8512 | 0.8246 | 0.8247 | 2 |
| Telu | 62387 | 0.99997 | 0.9999 | 0.9999 | 1 |
| Thai | 83820 | 0.99995 | 0.9998 | 0.9999 | 1 |
| Hant | 152723 | 0.9945 | 0.9954 | 0.9949 | 2 |
| Hans | 92689 | 0.9893 | 0.9870 | 0.9882 | 1 |
1from transformers import AutoTokenizer, AutoModelForSequenceClassification, pipeline
2
3tokenizer = AutoTokenizer.from_pretrained("alexneakameni/language_detection")
4model = AutoModelForSequenceClassification.from_pretrained("alexneakameni/language_detection")
5
6language_detection = pipeline("text-classification", model=model, tokenizer=tokenizer)
7
8text = "Hello world!"
9predictions = language_detection(text)
10print(predictions)