Views
No views yet
| Category | Tools |
|---|---|
| ML | scikit-learn, XGBoost, LightGBM |
| Data | pandas, NumPy |
| Evaluation | sklearn metrics |
pip install -r requirements.txt1python train.py
2python inference.py --input data/urls.csv --output priorities.csv05_crawl-priority-ml/
├── config.py
├── train.py # Priority (regression) and indexable (classification)
├── inference.py
├── requirements.txt
├── .env.example
├── data/
│ ├── crawl_features.csv # Sample: features + priority, indexable
│ └── urls.csv # Sample inference input (features only)
└── models/data/crawl_features.csv (training: features + priority, indexable), data/urls.csv (inference: same feature columns only).depth, internal_links, content_length, word_count, is_canonical. Targets: priority, indexable.DATA_PATH in .env if using another file.