Pipeline complet de scraping, extraction, nettoyage et préparation d'un dataset Java pour continual fine-tuning de CodeBERT V2.
vulnia-v2/
├── config/
│ └── scraping_queries.yaml # Requêtes GitHub par famille/sous-type
├── scraper/
│ ├── __init__.py
│ ├── constants.py # Patterns API, CWE mapping
│ ├── utils.py # Nettoyage code Java, hash, leakage
│ ├── ghsa_client.py # Client API GHSA + synthetic fallback
│ ├── reference_extractor.py # Extraction URLs GitHub
│ ├── code_fetcher.py # Fetch fichiers .java
│ ├── fence_extractor.py # Extraction code fences
│ ├── reporter.py # Rapport qualité
│ └── stages/ # Scripts de pipeline
├── run_pipeline.py # Orchestrateur unifié
├── scrape_vulnia_v2.py # Pipeline principal (synthetic + nettoyage)
├── verify_vulnia_v2.py # Vérification dataset final
├── vulnia_v2_label_mapping.json # Mapping labels 0-67
├── requirements.txt
└── README.md
1git clone https://huggingface.co/MaryamEl/vulnia-v2-scraper
2cd vulnia-v2-scraper
3pip install -r requirements.txt
1export GITHUB_TOKEN="ghp_xxxxxxxx"
2python run_pipeline.py --stage all
1python run_pipeline.py --stage collect-advisories
2python run_pipeline.py --stage dedup-advisories
3python run_pipeline.py --stage extract-advisory-references
4python run_pipeline.py --stage fetch-advisory-code
5python run_pipeline.py --stage extract-advisory-code-fences
6python run_pipeline.py --stage advisory-report
This model repository was generated by
ML Intern, an agent for machine learning research and development on the Hugging Face Hub.