Views
No views yet
<|det|>種別 [x1,y1,x2,y2]<|/det|>)付きで読み順どおりのテキスト(表はHTML)を出力します。<image> トークンを含める形式です:1# pip install mlx-vlm (0.6.7で動作確認)
2from mlx_vlm import load, generate
3
4model, processor = load("tokimoa/unlimited-ocr-mlx-4bit")
5out = generate(model, processor, "<image>document parsing.",
6 image=["page.png"], max_tokens=4096, temperature=0.0)
7print(out.text)"<image>Multi page parsing."(上流README準拠)。baidu/Unlimited-OCR(公式重み)mlx-vlm 0.6.7 convert -q --q-bits 4(2.4GB)