Views
No views yet
| Property | Value |
|---|---|
| Base model | CohereLabs/cohere-transcribe-03-2026 |
| Compute precision | FP16 (activations), 4-bit palettized (weights) |
| Frontend precision | FP32 (STFT/log-mel) |
| Total size | ~1.0 GB |
| WER (LibriSpeech test-clean, 500 samples) | 2.50% |
| Speed (GPU only) | ~48x realtime |
| Speed (ANE+GPU async) | ~72x realtime |
| Platform | macOS 13+ / Apple Silicon |
| Package | Size | Role |
|---|---|---|
cohere_frontend.mlpackage | 1.5 MB | Audio → log-mel features (FP32) |
cohere_encoder.mlpackage | 893 MB | Conformer encoder (palettize4) |
cohere_cross_kv_projector.mlpackage | 8.1 MB | Pre-compute cross-attn K/V once per chunk |
cohere_decoder_cached.mlpackage | 65 MB | Autoregressive decoder with KV cache |
cohere_decoder_fullseq_masked.mlpackage | 73 MB | Full-sequence decoder (for validation) |
1# Build Swift CLI
2cd swift_runner && swift build -c release
3
4# Run (GPU only)
5.build/release/pure_coreml_asr_cli \
6 --audio input.mp3 \
7 --artifacts-dir ./artifacts \
8 --compute gpu
9
10# Run (ANE+GPU heterogeneous, ~72x realtime)
11.build/release/pure_coreml_asr_cli \
12 --audio input.mp3 \
13 --artifacts-dir ./artifacts \
14 --compute gpu \
15 --compute-split ane_small| Variant | Repo | Size | WER |
|---|---|---|---|
| 4-bit (this) | CoreML-4bit | 1.0 GB | 2.50% |
| 6-bit | CoreML-6bit | 2.9 GB | 2.43% |
| FP16 | CoreML-fp16 | ~3.5 GB | baseline |