Il s'agit des pdfs preparsés qui peuvent être ensuite utilisé dans des appli autour du NLP / LLMs dans un soucis de collaborations.
Les différents codes ont été extrait en format XML ici :
https://codes.droit.org/
Les formats XML permet de faire un meilleurs preprocessing des codes de loi.
La structure des données :
dans raw/ on retrouve les différents codes en format xml.
dans notebooks_preprocess/ on retrouve les différents notebooks qui ont permis de constitué le dataset final.