Base model microsoft/deberta-v3-large
Domain data 1.2 M English tweets mentioning long-COVID (January 2020 → May 2025)
Objective Masked-Language-Modeling (MLM) for downstream COVID-NLP tasks
Trained with 🤗 Transformers 4.41 / 🤗 Datasets 2.21 / PyTorch 2.3 on 2 × NVIDIA H100 (192 GB)
1python -m pip install -U transformers datasets accelerate==0.29
2torchrun --nnodes 1 --nproc_per_node 2 pretrain_deberta_v3_large_covid.py \
3 --epochs 20 --lr 5e-5 --per_device_bs 32 --fp16 \
4 --csv_pattern ".../*.csv" --output_dir ".../pretrain_deberta_large_covid_with_val/"
1@misc{dap-deberta-covid2025,
2 title = {DeBERTa-v3-large Domain-Adaptive Pre-Training on LONG-COVID Tweets},
3 author = {Kumar, S. and Contributors},
4 year = {2025},
5 howpublished = {\url{https://huggingface.co/your-username/deberta-v3-large-covid2025-mlm}}
6}