Views
No views yet
AutoModel / AutoProcessorbfloat16 推理配置/home/zhangtao/env/xtuner/bin/pythonmodel.safetensors: 合并后的主模型权重config.json: 主配置generation_config.json: 生成配置preprocessor_config.json: 图像预处理配置test_hf.py: 单图推理与可视化示例脚本gradio_bbox_demo.py: 整图画框、后端裁剪和全图回映射的 Gradio 脚本conversion_report.json: 与 xtuner 对齐验证结果radio_bundle/: 打包后的 C-RADIO 相关实现AutoModel 和 AutoProcessor 拉起trust_remote_code=True1/home/zhangtao/env/xtuner/bin/python \
2 /home/zhangtao/hf_model/vectorllm_hf_0407/test_hf.py \
3 /home/zhangtao/hf_model/vectorllm_hf_0407 \
4 /path/to/your_image.png \
5 --save-dir /tmp/vectorllm_hf_demooverlay.png: 叠加 polygon 的可视化结果report.json: 文本输出、网格坐标、回映射后的 polygonsys.path,再导入包本身完成本地注册:1import sys
2from pathlib import Path
3
4import torch
5from PIL import Image
6from transformers import AutoModel, AutoProcessor, GenerationConfig
7
8model_path = Path("/home/zhangtao/hf_model/vectorllm_hf_0407")
9sys.path.insert(0, str(model_path.parent))
10import vectorllm_hf_0407 # noqa: F401
11
12from vectorllm_hf_0407.test_hf import DEFAULT_RAW_PROMPT, decode_generated_text, get_stop_criteria
13
14model = AutoModel.from_pretrained(
15 model_path,
16 trust_remote_code=False,
17 torch_dtype=torch.bfloat16,
18).cuda().eval()
19processor = AutoProcessor.from_pretrained(model_path, trust_remote_code=False)
20tokenizer = processor.tokenizer
21
22image = Image.open("/path/to/your_image.png").convert("RGB")
23model_inputs = processor(text=[DEFAULT_RAW_PROMPT], images=[image], return_tensors="pt")
24model_inputs = {
25 key: value.to(model.device) if torch.is_tensor(value) else value
26 for key, value in model_inputs.items()
27}
28
29stop_criteria = get_stop_criteria(tokenizer, ["<|im_end|>", "<|endoftext|>"])
30output = model.generate(
31 **model_inputs,
32 generation_config=GenerationConfig(
33 max_new_tokens=640,
34 do_sample=False,
35 eos_token_id=tokenizer.eos_token_id,
36 pad_token_id=tokenizer.pad_token_id or tokenizer.eos_token_id,
37 temperature=0.0,
38 top_k=1,
39 ),
40 bos_token_id=tokenizer.bos_token_id,
41 stopping_criteria=stop_criteria,
42 output_hidden_states=False,
43 return_dict_in_generate=True,
44 do_sample=False,
45 temperature=0.0,
46 top_k=1,
47)
48
49text = decode_generated_text(output, model_inputs, tokenizer)
50print(text)1/home/zhangtao/env/xtuner/bin/python \
2 /home/zhangtao/hf_model/vectorllm_hf_0407/gradio_bbox_demo.py \
3 --model-path /home/zhangtao/hf_model/vectorllm_hf_0407 \
4 --server-name 0.0.0.0 \
5 --server-port 78611.0-1.3 可调扩展比例裁剪Prompt Target 选择 Building 或 Object。BBox Expand Ratio 控制后端扩框比例。1.0 表示仅按原框裁剪,1.15 或 1.2 通常更稳,1.3 适合给目标留更多上下文。Run 执行推理,点击 Clear 清空当前图像和框。Full-Image Overlay: 全图可视化结果,同时叠加原始 bbox、扩框后的 bbox 和回映射后的 polygonExpanded Crop Preview: 每个 bbox 对应的裁剪图及其局部 polygon,可用来快速检查裁剪是否合理Model Text Output: 模型原始输出文本,便于排查 <xN><yN> 序列Structured Result: 结构化 JSON,包含原框、扩框、裁剪尺寸、网格坐标和全图坐标 polygon7861 端口,可通过 --server-port 调整Ctrl+C 即可<xN><yN> 格式的离散 polygon 点序列0~127sys.path.insert(...) 和 import vectorllm_hf_0407