The model was continually pretrained on a curated corpus of Vietnamese legal texts, including:
The model was trained using full-parameter fine-tuning (no quantization or LoRA). Below is the training setup used for continual pretraining:
1# Load model directly
2from transformers import AutoTokenizer, AutoModelForCausalLM
3
4tokenizer = AutoTokenizer.from_pretrained("VLSP2025-LegalSML/qwen3-1.7b-legal-pretrain")
5model = AutoModelForCausalLM.from_pretrained("VLSP2025-LegalSML/qwen3-1.7b-legal-pretrain")
This model is developed and maintained by the VLSP 2025 LegalSLM Task Organizers.
For inquiries, please contact:
leanhcuong@tdtu.edu.vn