Views
No views yet
export_onnx.py --fp16 导出 ONNX 后转换得到。vision_encoder / embed / lm_head / projector
实际按 fp16 计算,LLM decoder 因内部结构(静态序列长度 512、无真正 KV cache)
在 CPU 上仍走 fp32 计算路径。En.png、中文 qikai.png 均已验证)。| 文件 | 说明 |
|---|---|
model.json | 模型元信息(结构、维度、词表大小等) |
vocab.txt | 分词器词表(120818 词条) |
merges.txt | BPE 合并规则 |
image_begin.bin / image_end.bin / image_newline.bin | 图像占位符 token 的 embedding |
| 文件 | 大小 | 说明 |
|---|---|---|
vision_encoder.ncnn.param / .bin | 844M | CLIP 视觉编码器(fp16) |
perceptron_weights.bin | 118M | 感知机/投影前权重 |
pos_embed_32x32.bin | 4.5M | 32×32 位置编码 |
projector.ncnn.param / .bin | 2.1M | 视觉特征 → 文本空间投影层(fp16) |
| 文件 | 大小 | 说明 |
|---|---|---|
decoder.ncnn.param / .bin | 809M | 主解码网络(含 prefill + decode,CPU 走 fp32) |
decoder_prefill.ncnn.param | 75K | prefill 阶段子图 |
decoder_decode.ncnn.param | 78K | decode 阶段子图 |
embed.ncnn.param / .bin | 236M | 词嵌入层(fp16) |
lm_head.ncnn.param / .bin | 236M | 输出词表投影头(fp16) |
1./build-cpu/hunyuan_ocr.exe \
2 --model assets/hunyuan_ocr_ncnn_fp16 \
3 --image source/En.png \
4 --prompt "请识别图片中的文字内容" \
5 --quant fp16 \
6 --threads 8 \
7 --max-tokens 4096--quant fp16:运行时开启 fp16 计算路径(见 src/quant_opt.h)。--use-vulkan 1(此时仅 fp16 路径生效,int8 无效)。hunyuan_ocr_ncnn_int8)仅把
embed / lm_head 转为 int8,其余(含 vision_encoder、decoder、projector)
直接复用本目录的文件,因此输出与本目录逐字节一致。../hunyuan_ocr_ncnn_int8/README.md。