Views
No views yet
| Component | Quantization |
|---|---|
| Text decoder (+ embeddings) | 4-bit, group size 64, affine |
| Audio tower (AuT encoder + projector) linear layers | 8-bit, group size 64, affine |
| Conv / norm / positional layers | float (MLX has no quantized conv) |
config.json under
quantization[<layer path>] (standard MLX per-layer overrides): the audio
tower linear layers carry {"bits": 8, "group_size": 64} entries while the
global default is 4-bit / group size 64.1from mlx_audio.stt.models.qwen3_asr import qwen3_asr
2qwen3_asr.Qwen3ASRModel.model_quant_predicate = lambda self, p, m: True
3
4from mlx_audio.stt.utils import load_model
5model = load_model("Alkd/TEA-ASR-1.1-MLX-4bit")
6result = model.generate("audio.wav", language="Chinese")
7print(result.text)config.json
(mlx-lm-style loading, custom MLX Swift loaders) need no override.