Views
No views yet
moonshotai/Kimi-Audio-7B-Instruct,
repackaged to load directly into HuggingFace's
transformers.models.qwen2_5_omni.Qwen2_5OmniToken2WavBigVGANModel:weight_g / weight_v shards (NVIDIA-BigVGAN weight_norm parametrization)
have been fused into plain .weight tensors..filter buffers have been dropped
(HF marks them persistent=False and regenerates them from config at
module construction).model.safetensors; the original config is
preserved verbatim.config.json — copied verbatim from upstream vocoder/config.jsonmodel.safetensors — pre-fused BigVGAN weightsLICENSE — MIT (from upstream)moonshotai/Kimi-Audio-7B-Instruct. See LICENSE.1from huggingface_hub import hf_hub_download
2from safetensors.torch import load_file
3from transformers.models.qwen2_5_omni.configuration_qwen2_5_omni import (
4 Qwen2_5OmniBigVGANConfig,
5)
6from transformers.models.qwen2_5_omni.modeling_qwen2_5_omni import (
7 Qwen2_5OmniToken2WavBigVGANModel,
8)
9import json
10
11config_path = hf_hub_download("zhangj1an/kimi-audio-bigvgan-hf", "config.json")
12weights_path = hf_hub_download("zhangj1an/kimi-audio-bigvgan-hf", "model.safetensors")
13
14h = json.load(open(config_path))
15hf_config = Qwen2_5OmniBigVGANConfig(
16 mel_dim=h["num_mels"],
17 upsample_initial_channel=h["upsample_initial_channel"],
18 resblock_kernel_sizes=h["resblock_kernel_sizes"],
19 resblock_dilation_sizes=h["resblock_dilation_sizes"],
20 upsample_rates=h["upsample_rates"],
21 upsample_kernel_sizes=h["upsample_kernel_sizes"],
22)
23model = Qwen2_5OmniToken2WavBigVGANModel(hf_config)
24model.load_state_dict(load_file(weights_path))