Views
No views yet
hpd_generate.py)。レイアウト親ブランチが<BLOCK>種別 [座標]<FORK>のスケルトンを生成し、各<FORK>から共有KVキャッシュを継承した子ブランチが中身を埋め、接ぎ合わせて完全なパース結果(レイアウト座標+テキスト+HTMLテーブル)を返します。A4文書1ページ約5秒・ピークメモリ3.6GB。必要バージョン: mlx-vlm 0.6.8以降(または main)。0.6.7以前のinternvl_chatはQwen3系LMに未対応です。上流のP-MTP(投機デコード)ヘッドは本変換には含みません(HPD自体はMTPなしで動作します)。
1pip install "git+https://github.com/Blaizzy/mlx-vlm.git" timm einops torch
2# repoをダウンロードして同梱スクリプトを実行
3hf download tokimoa/hpd-parsing-mlx-8bit --local-dir hpd-8bit
4python hpd-8bit/hpd_generate.py document.png<BLOCK>title [63, 45, 187, 77]<CHILD>請求書
<BLOCK>table [64, 185, 937, 350]<CHILD><table><tr><td>品目</td><td>数量</td>...</table>
<BLOCK>text [533, 440, 727, 464]<CHILD>合計: 880,000円document parsing with fork.固定です(自由QAには非対応の特化モデルです)。generate_hpd(greedy・同一入力)との比較で、請求書1ページのパース結果が741文字中740文字一致(唯一の差は両実装とも誤読している小文字セルのbf16ゆらぎ)PaddlePaddle/HPD-Parsing(公式BF16。P-MTPヘッドは除外)convert -q --q-bits 8hpd_generate.py・conversation.py・image_preprocess.py)