Views
No views yet
onnxruntime만으로 추론한다 — torch가 필요 없다.kresnik/wav2vec2-large-xlsr-korean (Apache-2.0)
· 확인 커밋 629c9a3501c10ba128bf3fa1eebb12af3be03f61
베이스: facebook/wav2vec2-large-xlsr-53 (Apache-2.0)Wav2Vec2ForCTC → ONNX opset 17.
동적 축(samples/frames), attn_implementation="eager", apply_spec_augment=False.onnxruntime.quantization.quantize_dynamic(weight_type=QInt8).
1,267 MB → 318 MB (4.0배 축소).LICENSE.txt · 상세 고지: NOTICE.md| 파일 | 내용 |
|---|---|
model.int8.onnx | 양자화된 ONNX 모델 (318 MB) |
vocab.json | 토크나이저 vocab 1207개 (한글 완성형 음절) |
meta.json | blank_id=1204 · 구분자 ` |
meta.json이 없으면 logits는 그냥 숫자 덩어리다. 세 파일을 함께 쓴다.python/src/moviecut/aligner.py (OnnxCtcAligner).do_normalize=true).🚨 wav2vec2의 마지막 프레임은 오디오와 무관하게 '다'를 확률 1.0으로 뱉는다. 정렬 DP가 마지막 토큰을 거기 붙여 버려 마지막 단어가 조용히 깨진다. 처방: 뒤에 무음 100ms를 덧대고 끝 2프레임을 버린다.
| 지표 | faster-whisper 내장 | 이 모델 (int8) |
|---|---|---|
| 단어 시작 잔차 p90 | 157.4 ms | 24.4 ms |
| 단어 끝 잔차 p90 | 217.7 ms | 48.7 ms |