Views
No views yet
| Metric | Giá trị |
|---|---|
| Best Val Accuracy | 86.0% |
| F1 — Phát âm đúng | 0.92 |
| F1 — Phát âm sai | 0.45 |
| ONNX Latency | 48.8ms (CPU) |
| ID | Label | Mô tả |
|---|---|---|
| 0 | correct | ✓ Phát âm đúng (chuẩn) |
| 1 | error | ✗ Phát âm sai (ngọng) |
nguyenvulebinh/wav2vec2-large-vi-vlsp20201import onnxruntime as ort
2import librosa
3import numpy as np
4
5# Load model
6sess = ort.InferenceSession("phoneme_classifier_all.onnx")
7
8# Load audio (16kHz, 500ms)
9audio, _ = librosa.load("your_audio.wav", sr=16000, mono=True)
10audio = audio[:8000] # 500ms at 16kHz
11if len(audio) < 8000:
12 audio = np.pad(audio, (0, 8000 - len(audio)))
13
14# Normalize
15std = audio.std()
16if std > 0:
17 audio = (audio - audio.mean()) / std
18
19# Inference
20logits = sess.run(None, {"input_values": audio.reshape(1, -1).astype(np.float32)})[0][0]
21probs = np.exp(logits) / np.exp(logits).sum()
22is_correct = int(np.argmax(probs)) == 0
23
24print(f"Correct: {is_correct}")
25print(f"Confidence: {probs[int(np.argmax(probs))]*100:.1f}%")phoneme_classifier_all.onnx — ONNX model graphphoneme_classifier_all.onnx.data — ONNX model weightsbest_model.pt — PyTorch checkpointconfig.json — Label map + metadatapreprocessor_config.json — Wav2Vec2 feature extractor config