Views
No views yet

mamba create -n deepseek-ocr-2 python=3.12.9
mamba activate deepseek-ocr-2
pip install torch==2.6.0 torchvision Pillow transformers==4.46.3 tokenizers==0.20.3 einops addict easydict1from transformers import AutoModel, AutoTokenizer
2import torch
3
4model_name = '.'
5
6tokenizer = AutoTokenizer.from_pretrained(model_name, trust_remote_code=True)
7model = AutoModel.from_pretrained(model_name, trust_remote_code=True, use_safetensors=True)
8model = model.eval().to("cpu").to(torch.float16)
9
10# prompt = "<image>\nFree OCR. "
11prompt = "<image>\n<|grounding|>Convert the document to markdown. "
12image_file = 'samples/paper.png'
13output_path = 'tmp'
14
15res = model.infer(
16 tokenizer,
17 prompt=prompt,
18 image_file=image_file,
19 output_path = output_path,
20 base_size = 1024,
21 image_size = 768,
22 crop_mode = True,
23 save_results = True,
24 test_compress = True,
25)1- model.eval().to("cpu").to(torch.float16)
2+ model = model.eval().to("mps").to(torch.float16)
3
4res = model.infer(
5 tokenizer,
6 prompt=prompt,
7 image_file=image_file,
8 output_path = output_path,
9 base_size = 1024,
10 image_size = 768,
11 crop_mode = True,
12 save_results = True,
13 test_compress = True,
14+ device = "mps",
15+ dtype = torch.float16,
16)bfloat16 to get as close as possible to the original implementation.1- model.eval().to("cpu").to(torch.float16)
2+ model = model.eval().to("cuda").to(torch.bfloat16)
3
4res = model.infer(
5 tokenizer,
6 prompt=prompt,
7 image_file=image_file,
8 output_path = output_path,
9 base_size = 1024,
10 image_size = 768,
11 crop_mode = True,
12 save_results = True,
13 test_compress = True,
14+ device = "cuda",
15+ dtype = torch.bfloat16,
16)