-
-
训练量大约 1B Token,包含 4 种不同语言的语料
-
主要训练参数
- Batch Size : 1792
- Learing Rate : 5e-04
- Maximum Sequence Length : 512
- Optimizer : adamw_torch
- LR Scheduler: warmup_stable_decay
- Train Precision : bf16 mix
-
使用说明
- 暂无,基础模型一般不直接使用,需针对具体下游任务进行微调后使用
-
在 Base 模型的基础上,使用了大约 100,000 条合成语料进行 NER 任务的微调
-
与人工校对的实体词语表进行对比,可以达到 90%-95% 的实际准确率
- 与 KeywordGacha 搭配使用时
- 实际任务环境中的实测数据,并非预设测试集上的 F1 Score 这类理论上的指标
-
训练参数如下:
- Batch Size : 32
- Learing Rate : 6e-06
- Optimizer : adamw_torch
- LR Scheduler: cosine
- Warnup Ratio : 0.1
- Train Precision : bf16 mix
-
使用说明