Modèle NLLB-200 fine-tuné pour la traduction de dialogues de jeux Ren’Py (anglais → français), optimisé pour la préservation des balises et la fluidité du texte.
🚀 Utilisation rapide
from transformers import AutoTokenizer, AutoModelForSeq2SeqLM
📂 ID ou chemin local du modèle
MODEL_ID = "./nllb-renpy-rory" # ou "virusf/nllb-renpy-rory" sur Hugging Face
Préserver les tags : passe la ligne telle quelle (ex:
"Oh my....(06)...You really sure about that...?")
Textes longs (intro/EULA) → augmenter max_new_tokens (220–320)
Vitesse max → num_beams=1 (greedy), use_fast=True et
pip install protobuf
📊 Données & Prétraitement
Données extraites depuis scripts .rpy de jeux Ren’Py
Nettoyage et normalisation des balises
Division train/val
Tokenisation NLLB officielle
⚙️ Entraînement
Base : facebook/nllb-200-distilled-600M
Fine-tuning : RTX 4070, batch dynamique
3 epochs, beam search par défaut (num_beams=3)