Views
No views yet
ncoder-ai/VibeVoice-Large-AWQ insteadncoder-ai/VibeVoice-Large-AWQ.transformers.from_pretrained() loads it directly, no manual
graft step. Same speed, same VRAM (~8.4 GB), same audio quality.1from vibevoice.modular.modeling_vibevoice_inference import VibeVoiceForConditionalGenerationInference
2import torch
3
4model = VibeVoiceForConditionalGenerationInference.from_pretrained(
5 "ncoder-ai/VibeVoice-Large-AWQ",
6 torch_dtype=torch.float16,
7 device_map="cuda:0",
8).eval()1import torch, gc
2from vibevoice.modular.modeling_vibevoice_inference import VibeVoiceForConditionalGenerationInference
3from awq import AutoAWQForCausalLM
4
5# Your custom FP16 base
6model = VibeVoiceForConditionalGenerationInference.from_pretrained(
7 "rsxdalv/VibeVoice-Large", torch_dtype=torch.float16, device_map="cuda:0",
8).eval()
9
10# Free FP16 LLM, graft AWQ Qwen2 in its place
11del model.model.language_model
12gc.collect(); torch.cuda.empty_cache()
13
14awq = AutoAWQForCausalLM.from_quantized(
15 "ncoder-ai/VibeVoice-Large-AWQ-INT4",
16 device_map={"": 0}, safetensors=True, fuse_layers=False,
17)
18model.model.language_model = awq.model.model
19del awq; gc.collect(); torch.cuda.empty_cache()rsxdalv/VibeVoice-Large.