It is fine-tuned from
Qwen2.5-VL-7B-Instruct with supervised chain-of-thought (CoT) reasoning on document-forgery data.
1import cv2, torch
2from PIL import Image
3from transformers import AutoProcessor, Qwen2_5_VLForConditionalGeneration
4from qwen_vl_utils import process_vision_info
5
6MODEL_PATH = "vankey/DocShield-7B"
7
8model = Qwen2_5_VLForConditionalGeneration.from_pretrained(
9 MODEL_PATH,
10 torch_dtype=torch.float32,
11 attn_implementation="eager",
12 device_map="auto",
13)
14model.eval()
15processor = AutoProcessor.from_pretrained(MODEL_PATH)
16
17SYSTEM_PROMPT = (
18 "你是一个图像鉴伪专家,擅长结合视觉,文字结合伪造特征分析手段鉴别输入图像的真假。"
19 "分析过程中,你会逐步分析,抽丝剥茧,找到图像伪造的蛛丝马迹,最终给出专业的鉴别结果及分析。"
20)
21USER_PROMPT = "请帮我分析这张图片是否是伪造的,并给出分析报告."
22
23image = cv2.cvtColor(cv2.resize(cv2.imread("image.jpg"), (1344, 896)), cv2.COLOR_BGR2RGB)
24image = Image.fromarray(image)
25
26messages = [
27 {"role": "system", "content": SYSTEM_PROMPT},
28 {"role": "user", "content": [
29 {"type": "image", "image": image},
30 {"type": "text", "text": USER_PROMPT},
31 ]},
32]
33
34text = processor.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
35image_inputs, video_inputs = process_vision_info(messages)
36inputs = processor(text=[text], images=image_inputs, videos=video_inputs,
37 padding=True, return_tensors="pt").to(model.device)
38
39with torch.no_grad():
40 out = model.generate(**inputs,
41 do_sample=True, temperature=1.0, top_p=1.0,
42 top_k=0, repetition_penalty=1.0,
43 max_new_tokens=8192)
44
45generated = out[:, inputs["input_ids"].shape[1]:]
46print(processor.batch_decode(generated, skip_special_tokens=True)[0])
1@article{docshield2026,
2 title={DocShield: A Forensic Vision-Language Model for Document Forgery Analysis},
3 author={DocShield},
4 year={2026},
5 url={https://arxiv.org/abs/2604.02694}
6}
Apache-2.0.