Views
No views yet
shion-v4.2-small flat checkpoint on a context-rich, homophone-contrast-reweighted mix. Best fused-pipeline score in the series (AJIMEE EM@1 0.765 with beam20 + n-gram + dictionary fusion, fp32), model-only greedy 0.755. Same I/O contract as the v4.2 family.| file | 内容 |
|---|---|
shion-v4.4-small-anneal-lr2e4-h10k-v41mix-step8k.fp32.onnx + .data | fp32(推奨。下記 Eval の主数値) |
shion-v4.4-small-anneal-lr2e4-h10k-v41mix-step8k.int8.onnx | 動的 int8 量子化(軽量、劣化あり、下記参照) |
shion-v4.4-small-anneal-lr2e4-h10k-v41mix-step8k.fp32.tokenizer.json.vocab.hex.tsv | vocab(id → token の hex 表現、v4.2 系と共通) |
shion-v4.2-small の flat チェックポイント(未アニーリング)を起点に LR 2e-4 / 10k step の cosine re-anneal。データは文脈長に応じた再重み付け + 同音語ペアの少数派表記 upweight + 固有名詞/助数詞補強を加えた in-house 日本語コーパス。deliverable は途中 peak の step 8000(終端は over-sharpen)input: input_ids int64 (batch, seq) seq ≤ 128
input: attention_mask int64 (batch, seq) 1 = 有効
output: logits float (batch, seq, 4801)[CLS] <context(左 trim)> [SEP] <reading>。特殊 token id: [PAD]=0 [UNK]=1 [SEP]=2 [CLS]=3 [BLANK]=4 [MASK]=5。デコードは logits の argmax → CTC collapse(連続同一 id 圧縮 → blank=4 除去)→ 特殊 token 除去 → vocab で文字列化。vocab TSV は id \t hex(UTF-8 バイト列の 16 進)、<0xXX> 行は byte-fallback。最小 Python 例は anneal-step12k の card と同一(ファイル名だけ読み替え)。| 構成 | EM@1 | EM@5 |
|---|---|---|
| fp32 + beam20 + n-gram(α0.2) + 辞書融合(γ0.5) + 記号分割(最良構成) | 0.765 | 0.865 |
| fp32 + greedy(モデル単体、融合なし) | 0.755 | 0.755 |
| int8 + greedy | 0.715 | 0.715 |
(参考)anneal-step12k の配備構成(int8mp24 + 融合) | 0.765 | 0.875 |
〓 等の代替記号を出力することがあります