Views
No views yet
| Detail | Value |
|---|---|
| Architecture | ResNet34 with statistics pooling |
| Parameters | ~6.6M |
| Input | 80-bin log-mel spectrogram (16kHz) |
| Output | 256-dim L2-normalized speaker embedding |
| BatchNorm | Fused into Conv2d at conversion time |
1let model = try await WeSpeakerModel.fromPretrained(backend: .coreML)
2let embedding = model.embed(audio: samples, sampleRate: 16000)
3let similarity = WeSpeakerModel.cosineSimilarity(embeddingA, embeddingB)| Variant | Backend | Model ID |
|---|---|---|
| MLX | GPU | aufklarer/WeSpeaker-ResNet34-LM-MLX |
| CoreML | Neural Engine | aufklarer/WeSpeaker-ResNet34-LM-CoreML |