| 文件 | 大小 | 说明 |
|---|---|---|
vision_encoder.onnx | 264 MB | Vision Encoder (Hiera backbone + FPN) |
mask_decoder.onnx | 16 MB | Mask Decoder (点/bbox prompt → mask) |
conv_s0.npz | 33 KB | FPN conv 权重 (256→32 ch) |
conv_s1.npz | 65 KB | FPN conv 权重 (256→64 ch) |
prompt_encoder.npz | 29 KB | Prompt Encoder 权重 (位置编码 + 类型嵌入) |
preprocessor_config.json | — | 预处理配置 |
infer.py | — | 独立推理脚本 |
pip install numpy opencv-python onnxruntime1# 单点分割
2python infer.py --image photo.jpg --point 500 400
3
4# 多点分割 (每 2 个点自动分组)
5python infer.py --image photo.jpg --point 500 400 --point 600 300
6
7# bbox 中心点分割
8python infer.py --image photo.jpg --bbox 100 200 500 600
9
10# 保存结果
11python infer.py --image photo.jpg --point 500 400 --save result.png --save-mask mask.pngpixel_values — (1, 3, 1024, 1024) float32