Views
No views yet
w_kw=0.30, w_spk=0.65) with EMA smoothing and DET-calibrated threshold (τ=0.2222)| Dataset | Usage | Samples | License |
|---|---|---|---|
| Google Speech Commands v2 | Keyword spotting pre-training | 105K utterances | CC BY 4.0 |
| VoxCeleb1 | Speaker verification training | 153K utterances (1,251 speakers) | CC BY 4.0 |
| LibriPhrase | Hard-negative triplet pairs (up to 3K triplets generated from metadata) | Apache 2.0 | |
| MUSAN | Noise augmentation | 109 hrs | CC BY 4.0 |
| Metric | Achieved | Target | Status |
|---|---|---|---|
| Parameters | 1.806 M | < 3.0 M | ✅ |
| ONNX Model Size | 0.60 MB (INT8) | — | ✅ |
| CPU Latency | 26.43 ms (p95: 28.29 ms) | < 200 ms | ✅ |
| Real-Time Factor (xRT) | 0.0132 | < 0.20 | ✅ |
| Keyword EER (standalone) | 4.69% | low | ✅ |
| Speaker EER (standalone) | 17.86% | low | ✅ |
| Joint EER | 23.47% | — | — |
| Joint AUC | 0.8425 | — | ✅ |
| Optimal Scorer Weights | wₖw=0.30, wₛₚₖ=0.65 | — | ✅ |
| EER Threshold (τ) | 0.2222 | — | ✅ |