Views
No views yet
| Property | Value |
|---|---|
| Parameters | 1.5B class (backbone 1B + decoder + heads) |
| Quantization | fp16 |
| Size | ~3.3 GB |
| Codec | Mimi, 32 codebooks @ 12.5 Hz, 24 kHz |
| Languages | English |
| File | Description |
|---|---|
model.safetensors | backbone + decoder + heads + embeddings (fp16) |
config.json | architecture + per-module quantization map |
mimi.safetensors | Kyutai Mimi codec (32 codebooks) |
tokenizer.json | Llama BPE tokenizer |
| Metric | Value |
|---|---|
| RTF (int8) | ~0.5–0.9 (faster than real time) |
| First-audio latency (streaming) | ~120 ms |
1import CSM
2
3let pipeline = try await CSMPipeline(directory: modelDir)
4let audio = pipeline.synthesize(
5 text: "Hello from on-device speech.",
6 refAudio: referenceSamples, // 24 kHz mono
7 refText: "transcript of the reference",
8 temperature: 0.9, topK: 50)sesame/csm-1b (Apache-2.0).