Views
No views yet
nakamura196/metom-komonjo-onnx を参照。metom.onnx — ViT 単字分類器 (fp32 / 量子化なし)metom-labels.json — クラス id → 文字 の配列 (length = 2703)| input | pixel_values [batch, 3, 128, 128] float32 |
| output | logits [batch, 2703] (softmax で確率、argmax で文字 id) |
| 前処理 | 文字 crop を 128×128 へ resize → /255 → CLIP 正規化 → NCHW |
| 正規化 | mean = [0.48145466, 0.4578275, 0.40821073] / std = [0.26862954, 0.26130258, 0.27577711] |
config.labels に由来する。下記は原典モデルの公表値。本 ONNX は原典を fp32 のまま変換し、HF の example 画像で PyTorch と argmax 一致を検証済み(量子化なし)のため、原典と同等の挙動とみなせる。 ただし本リポジトリでの独立した再測定値ではない点に注意。
| 指標 | 値 |
|---|---|
| micro accuracy(全体) | 0.9722 |
| macro accuracy(クラス平均) | 0.8354 |
| 評価データ | 日本古典籍くずし字データセット (CODH)、テスト 216,645 字 |
| 学習データ | 同データセット 649,932 字(train:val:test = 3:1:1) |
| アーキテクチャ | Vision Transformer (ViT) ベース |