Views
No views yet
| 项目 | 内容 |
|---|---|
| 基座模型 | PaddleOCR-VL-1.6(0.9B) |
| 微调方式 | 两阶段 LoRA,权重已合并为单一模型 |
| 支持文字 | 规范彝文、汉字、拉丁字母、数字、标点 |
| 输入 | 单行、文本区域、整页、PDF 渲染页、拍摄图片 |
| 推理 | 最终权重已合并,无需额外加载 adapter |
| 评估集 | 1,030 张真实扫描 / 拍摄图片(519 页 + 511 区域),不含合成数据 |
| 指标 | 数值 | 说明 |
|---|---|---|
| 总 Avg NED | 0.0474 | 主指标,按模型原始输出计算 |
| 彝文 Avg NED | 0.0432 | 主指标,仅统计规范彝文字符 |
| 去空白 Avg NED | 0.0399 | 辅助参考,剔除空白与换行差异 |
| 规范化后 Avg NED | 0.0346 | 辅助参考,NFKC 兼容规范化 |
| 完全正确样本 | 333 张(32.3%) | 1,030 张中 333 张与标准答案逐字一致 |
评估集为 519 张整页 + 511 张区域 / 行图,共 1,030 张。其中书籍整页逐字一致率 54 / 437(12.4%),书籍区域 228 / 350(65.1%);整页与区域难度不同,不宜合并成单一“整页”指标看。
| 采集场景 | 样本 | NED |
|---|---|---|
| 书籍扫描 | 787 | 0.0259 |
| 屏幕拍照 | 164 | 0.0393 |
| 手写拍照 | 70 | 0.2000 |
| 实景拍照 | 9 | 0.0247 |
| 难度 | 样本 | NED |
|---|---|---|
| 低 | 271 | 0.0163 |
| 中 | 501 | 0.0239 |
| 高 | 258 | 0.0957 |
1hf download nanxidajun/NuosuBburma-OCR \
2 --repo-type model \
3 --local-dir models/NuosuBburma-OCR66317acc4c9fc17bd154591ce650735cd2855f3e 处核验为 Apache-2.0。使用时需同时遵守上游项目与数据来源的相关许可。