Views
No views yet
| Detail | Value |
|---|---|
| Audio encoder | 24 layers, 1024 dim, 16 heads, float16 |
| Text decoder | 28 layers, 1024 hidden, 16Q/8KV heads, 8-bit quantized (group_size=64) |
| Classify head | Linear(1024, 5000), float16 |
| Timestamp resolution | 80ms per class (5000 classes = 400s max) |
| Total size | ~1.4 GB |
1let aligner = try await Qwen3ForcedAligner.fromPretrained(
2 modelId: "aufklarer/Qwen3-ForcedAligner-0.6B-8bit"
3)
4let aligned = aligner.align(
5 audio: samples, text: "Hello world", sampleRate: 24000
6)| Variant | Size | Model ID |
|---|---|---|
| 4-bit | ~979 MB | aufklarer/Qwen3-ForcedAligner-0.6B-4bit |
| 8-bit | ~1.4 GB | aufklarer/Qwen3-ForcedAligner-0.6B-8bit |
| bf16 | ~1.8 GB | aufklarer/Qwen3-ForcedAligner-0.6B-bf16 |
| CoreML INT4 | ~630 MB | aufklarer/Qwen3-ForcedAligner-0.6B-CoreML-INT4 |
| CoreML INT8 | ~1.0 GB | aufklarer/Qwen3-ForcedAligner-0.6B-CoreML-INT8 |