f1
base_model: camembert-base
pipeline_tag: text-classification
model-index:
name: ida-rome-classifier-fr
results: []---
ROME Classifier FR — Projet IDA
Développé parEcoLLM
pour le Carif-Oref de Normandie dans le cadre du Projet IDA
(Initiative Diagnostic & Anticipation), 2026.
Voir la collection complète du projet.
Modèle de classification multi-classes prédisant le code ROME d'une
offre d'emploi (intitulé + description) parmi les 1 584 fiches du
Répertoire Opérationnel des Métiers et des Emplois, version 4.0.
Il complète un système RAG multi-agent en apportant une capacité que la
récupération seule ne fournit pas : l'auto-tagging ROME d'offres non
classifiées par l'employeur, et la détection d'incohérences dans les
codes déclarés.
Source primaire : 1 010 offres numériques Normandie (France Travail,
Licence ouverte Etalab), chaque offre étiquetée avec son romeCode
officiel.
Augmentation : 14 704 intitulés d'appellations ROME extraits du
référentiel arborescence_principale.xlsx (chaque fiche ROME fournit
~10 appellations alternatives — ex. pour A1101 : "Conducteur d'engins
agricoles", "Tractoriste agricole", "Opérateur d'épandage", …). Ces
appellations servent d'exemples synthétiques pour les classes que les
1 010 offres ne couvrent pas suffisamment, et sont filtrées hors des
splits val/test (qui restent 100 % "vraies" offres).
val / test : 97 offres réelles chacun, stratifié par ROME quand ≥ 3 exemples
Pipeline
text → CamemBERT-base (110 M) → pooler → linear(1584) → softmax → argmax
Entraîné 15 epochs sur OVH AI Training (NVIDIA L4, ~15 min).
Contexte empirique : une première version à 5 epochs plafonnait à
40 % accuracy@5 (loss 5.5, 13 % accuracy@1). Le portfolio actuel utilise
une version 15 epochs qui capture mieux la tête de distribution des ROME
fréquents. La macro-F1 reste faible : sur 1 584 classes et seulement 97
exemples de test, la plupart des classes ne sont pas représentées dans le
split de test et pèsent 0 dans la moyenne macro — accuracy@5 est la
métrique à regarder pour ce POC.
Biais et limites
Domaine : les 1 010 offres sources couvrent principalement les
métiers du numérique en Normandie. Le modèle est donc plus précis
sur les codes ROME des familles M18, H29, K24… et peut sous-performer
sur des familles peu représentées.
Appellations : l'augmentation déséquilibre les classes rares
vers un style "intitulé court" plutôt que "description longue".
L'accuracy@5 sur la description est donc plus robuste qu'accuracy@1.
Période : entraîné sur un snapshot avril 2026. Le référentiel ROME
évolue ; un ré-entraînement trimestriel est recommandé si l'API
France Travail introduit de nouvelles fiches.
Reproductibilité
Le training script (training.ipynb ou ml/rome_classifier/train.py du
dépôt projet-ida) est intégralement réexécutable. Un seed (42) fixe la
génération de splits. Les hyperparamètres exacts sont dans
training_args.json de ce dépôt.
Citation
bibtex
1@misc{ida_romeclassifier_2026,
2 title = {ida-rome-classifier-fr — Projet IDA},
3 author = {EcoLLM},
4 howpublished = {Commissioned by Carif-Oref de Normandie},
5 year = {2026},
6 url = {https://huggingface.co/ecollm/ida-rome-classifier-fr}
7}