Dataset này được tạo từ các báo cáo tài chính dạng Markdown trong thư mục BCTC_MD.
Dataset dùng cho continued pretraining / domain-adaptive pretraining mô hình ngôn ngữ trên miền báo cáo tài chính tiếng Việt.
Mỗi dòng trong train.jsonl hoặc validation.jsonl là một JSON object:
{
"text": "...",
"source_file": "AAA_BCTC_2020.md",
"document_id": "AAA_BCTC_2020",
"company": "AAA"… See the full description on the dataset page:
https://huggingface.co/datasets/Zenng2812/bctc-md-domain-corpus.