Modèle de classification de culture agricole à partir de requêtes vocales (TF-IDF + RandomForest)
Ce projet s’inscrit dans le cadre d’un assistant vocal intelligent destiné aux agriculteurs.
Il permet de déterminer automatiquement la culture concernée (maïs, sorgho, mil, etc.) à partir d'une question posée en français, comme par exemple :
"Quelle variété de maïs est adaptée à un sol sablonneux ?"
Ce modèle est une brique clé de notre pipeline IA : il sert à détecter la culture ciblée pour affiner les réponses données par un agent de type ChatGPT.
Données
Les données proviennent d’un corpus de 258 requêtes agricoles collectées manuellement et annotées par culture, thématique et intention.
Pour ce modèle, seule la culture est prédite.
Il s’agit d’une classification multi-classes (mono-label) avec 5 classes :
maïs
sorgho
arachide
mil
générique (si la culture n’est pas identifiable)
Modèle utilisé
Nous utilisons un pipeline basé sur :
TfidfVectorizer (avec 10 mots-clés sélectionnés automatiquement)
RandomForestClassifier
Ce choix a été fait suite à une comparaison rigoureuse entre plusieurs modèles (LogisticRegression, SVC, RF) et plusieurs tailles de vocabulaire (max_features = 10, 50, 100, 1000).
Le modèle RF avec max_features = 10 a obtenu les meilleurs scores F1-macro en validation croisée (5-folds).
Utilisation
Installation
1pip install huggingface_hub joblib
2
3contact : kadidiatou.diallo.k@gmail.com