CER = Σ Levenshtein(ref_i, pred_i) / Σ len(ref_i)
= 615 / 10819
= 5.68%
1import nemo.collections.asr as nemo_asr
2
3model = nemo_asr.models.EncDecHybridRNNTCTCBPEModel.restore_from("hiragana-parakeet-tdt-ctc-0.6b-ja.nemo")
4transcriptions = model.transcribe(["audio.wav"])
5print(transcriptions) # ['ひらがなのてきすと']
1import pyopenjtalk, jaconv
2
3text = "東京都渋谷区"
4kana = pyopenjtalk.g2p(text, kana=True) # "トーキョートシブヤク"
5hira = jaconv.kata2hira(kana) # "とーきょーとしぶやく"
同サイズの
Moonshine-base-ja (61.5M) が CER 3.9% を達成しており、Conformer+CTC/TDTアーキテクチャではこのサイズ帯で Encoder-Decoder+Attention 型に対抗するのは困難と判断しました。