Views
No views yet
pip install mlx safetensors numpy1from huggingface_hub import snapshot_download
2
3model_dir = snapshot_download("al-bo/gigaam-v3-rnnt-mlx")1from gigaam_mlx import load_model, load_audio
2
3model = load_model("./gigaam-v3-rnnt-mlx")
4text = model.transcribe(load_audio("audio.wav"))
5print(text)
6# → ничьих не требуя похвал счастлив уж я надеждой сладкойAudio (16kHz) → Log-Mel Spectrogram (64 bins)
→ Conv1d Subsampling (4× stride)
→ 16× Conformer Layers:
├─ FFN₁ (half-step residual)
├─ RoPE Multi-Head Self-Attention (16 heads)
├─ Convolution Module (GLU + depthwise conv)
└─ FFN₂ (half-step residual)
→ RNNT Head (Joint + LSTM Decoder)
→ Greedy Decode| Metric | Value |
|---|---|
| Batch (11s audio) | 230ms (48× realtime) |
| Model size | 423 MB (fp16) |
| Parameters | ~222M |
model.safetensors — weights (fp16, 423 MB)config.json — model config + vocabulary (34 Russian characters)convert_gigaam_to_mlx.py.
LSTM weights are transformed from PyTorch (weight_ih, weight_hh, bias_ih, bias_hh) to MLX layout (Wx, Wh, bias).