Views
No views yet
m3hrdadfi/wav2vec2-large-xlsr-persian — architecture: w2v2_ctc.nvfp4-pack-quantized (compressed-tensors). 4-bit FP4 weights, per-block FP8 (E4M3) scales, per-tensor FP32 global scales; activations dynamically quantized to FP4.Reza2kn/persian-asr-eval-v0 (held out from the WER eval set).lm_head / proj_out left full precision).Reza2kn/persian-asr-eval-v0 (FLEURS-fa)| Variant | WER ↓ | CER ↓ | clips | per-clip latency | peak VRAM |
|---|---|---|---|---|---|
| NVFP4 (this repo) | 35.18% | 10.40% | 200 | 86 ms | 1398 MiB |
1import torch
2import soundfile as sf
3from transformers import AutoProcessor, AutoModel
4
5repo = "Reza2kn/m3hrdadfi_wav2vec2-large-xlsr-persian-NVFP4"
6processor = AutoProcessor.from_pretrained(repo)
7# Load in bfloat16 — NVFP4 weights decompress to bf16 inside CompressedLinear.
8model = AutoModel.from_pretrained(repo, dtype=torch.bfloat16).to("cuda").eval()m3hrdadfi/wav2vec2-large-xlsr-persian model card for arch-specific decoding boilerplate.)llmcompressor QuantizationModifier(targets=["Linear"], scheme="NVFP4", ignore=...) →
compressed-tensors nvfp4-pack-quantized checkpoint.