Views
No views yet
pt-tupi-tokenizer é um tokenizador projetado especificamente para o idioma Tupi, uma língua indígena brasileira. Ele suporta a tokenização de textos Tupi de forma eficiente, preservando a morfologia e a estrutura própria do idioma. Este tokenizador pode ser usado em tarefas de NLP, como pré-processamento para modelos de linguagem, tradução ou análise textual em Tupi.1from transformers import AutoTokenizer
2
3tokenizer = AutoTokenizer.from_pretrained("CASLL/pt-tupi-tokenizer")
4
5text = "Teko porã"
6tokens = tokenizer.tokenize(text)
7ids = tokenizer(text)["input_ids"]
8
9print("Tokens:", tokens)
10print("IDs:", ids)| Texto Tupi | Tokens |
|---|---|
| Teko porã | ['Teko', 'porã'] |
| Abaeté | ['A', 'ba', 'eté'] |