Views
No views yet
1---
2language:
3- baq
4- bci
5- fr
6tags:
7- African NLP
8- low-resource language
9- sentencepiece
10- tokenizer
11- Baoulé
12- Côte d'Ivoire
13- translation
14- tonal language
15datasets:
16- custom
17license: apache-2.0
18library_name: transformers
19pipeline_tag: text2text-generation
20widget:
21- text: "Wafa sɛ yɛ ɔ fata kɛ be nga be lafi su kɛ bé trán asiɛ’n su wa’n, be bu be nga bé kɔ́ ɲanmiɛn"
22 example_title: "Traduction de base"
23---
24
25# Tokenizer Baoulé : Modèle de Traduction Français-Baoulé
26
27🌍 Premier tokenizer SentencePiece spécialisé pour la langue Baoulé (Côte d'Ivoire) 🇨🇮
28
29[](https://huggingface.co/votre_username/baoule-tokenizer)
30
31## Fonctionnalités Clés
32
33✅ Prise en charge complète des caractères tonals Baoulé (ɛ́, ɩ̄, ɔ̀, etc.)
34✅ Optimisé pour les modèles de traduction automatique (Transformer)
35✅ Vocabulaire de 206 tokens avec couverture linguistique complète
36✅ Intégration native avec 🤗 Transformers et Tokenizers
37✅ Compatible avec Google Traduction Custom Model et Amazon Translate
38
39## Installation et Utilisation
40
41```python
42from transformers import AutoTokenizer
43
44tokenizer = AutoTokenizer.from_pretrained("Adjoumani/BaouleTokenizer_V1")
45
46# Utilisation du tokenizer
47
48text = "Wafa sɛ yɛ ɔ fata kɛ be nga be lafi su kɛ bé trán asiɛ’n su wa’n, be bu be nga bé kɔ́ ɲanmiɛn"
49encoded = tokenizer.encode(text)
50decoded = tokenizer.decode(encoded)
51
52print(f"Tokens: {tokenizer.tokenize(text)}")
53# Output: ['W', 'a', 'f', 'a', '▁s', 'ɛ', '▁y', 'ɛ', '▁ɔ', '▁f', 'a', 't', 'a', '▁k', 'ɛ', '▁b', 'e', '▁n', 'g', 'a', '▁b', 'e', '▁l', 'a', 'f', 'i', '▁s', 'u', '▁k', 'ɛ', '▁b', 'é', '▁t', 'r', 'á', 'n', '▁a', 's', 'i', 'ɛ', '’', 'n', '▁s', 'u', '▁w', 'a', '’', 'n', ',', '▁b', 'e', '▁b', 'u', '▁b', 'e', '▁n', 'g', 'a', '▁b', 'é', '▁k', 'ɔ', '́', '▁ɲ', 'a', 'n', 'm', 'i', 'ɛ', 'n']| Paramètre | Valeur |
|---|---|
| Architecture | SentencePiece BPE |
| Taille du vocabulaire | 206 |
| Caractères couverts | 1.0 (Unicode) |
| Tokens spéciaux | [BOS], [EOS], [UNK], [PAD] |
| Langues cibles | Français ↔ Baoulé |
| Encodage | UTF-8 |
| Caractère | Code Unicode | Exemple |
|---|---|---|
| ɛ́ | U+025B U+0301 | Mɔ́kɛ́ |
| ɩ̄ | U+0269 U+0304 | Ɩ̄tɩ̄ |
| ɔ̀ | U+0254 U+0300 | Kɔ̀lɔ̀ |
| ɛ̂ | U+025B U+0302 | Ɛ̂sɛ̂ |
1# Pour gérer les phrases longues
2tokenizer.model_max_length = 512
3
4# Ajout de tokens personnalisés
5new_tokens = ["<dialect:NDÊ>", "<dialect:SAFOUÈ>"]
6tokenizer.add_tokens(new_tokens)1@misc{BaouleTokenizer2023,
2 author = {Votre Nom},
3 title = {Baoulé Tokenizer for Low-Resource Machine Translation},
4 year = {2023},
5 publisher = {Hugging Face},
6 howpublished = {\url{https://huggingface.co/Adjoumani/BaouleTokenizer_V1}}
7}