Views
No views yet
| Base model | microsoft/VibeVoice-ASR-HF |
| Quantization | INT8 8-bit (bitsandbytes) |
| Modules quantized | language_model.model.layers.* only |
| Modules in BF16 | acoustic_tokenizer_encoder, semantic_tokenizer_encoder, acoustic_projection, semantic_projection, lm_head |
| Model size | ~9 GB (down from 17.3 GB) |
| VRAM usage | ~10–11 GB |
| Transformers | >= 5.3.0 |
| bitsandbytes | >= 0.48.1 |
1import torch
2from transformers import AutoProcessor, VibeVoiceAsrForConditionalGeneration
3
4model_id = "Dubedo/VibeVoice-ASR-HF-INT8"
5
6processor = AutoProcessor.from_pretrained(model_id)
7model = VibeVoiceAsrForConditionalGeneration.from_pretrained(
8 model_id,
9 device_map="auto",
10 torch_dtype=torch.bfloat16,
11)
12
13inputs = processor.apply_transcription_request(
14 audio="path/to/audio.wav",
15 prompt="optional hotwords here",
16).to(model.device, model.dtype)
17
18output_ids = model.generate(**inputs)
19generated_ids = output_ids[:, inputs["input_ids"].shape[1]:]
20
21# Structured output with speaker, timestamps, text
22result = processor.decode(generated_ids, return_format="parsed")[0]BitsAndBytesConfig with llm_int8_skip_modules to protect audio-critical components:1BitsAndBytesConfig(
2 load_in_8bit=True,
3 llm_int8_skip_modules=[
4 "acoustic_tokenizer_encoder",
5 "semantic_tokenizer_encoder",
6 "acoustic_projection",
7 "semantic_projection",
8 "lm_head",
9 ],
10)