Views
No views yet
neuphonic/neucodec.neucodec/ package and
infer_widecodec.py. No other source code required.1pip install torch transformers huggingface_hub local-attention einops librosa soundfile
2huggingface-cli login # if this repo is private (or export HF_TOKEN=hf_...)
3
4huggingface-cli download Scicom-intl/WideCodec --local-dir WideCodec
5cd WideCodec
6python infer_widecodec.py --input my.wav --out-dir out # one file
7python infer_widecodec.py --input folder/ --out-dir out # a directory1import sys; sys.path.insert(0, "WideCodec") # the downloaded repo dir
2import torch, librosa
3from neucodec import NeuCodec
4
5model = NeuCodec._from_pretrained(model_id="Scicom-intl/WideCodec", decoder_depth=20).eval().cuda()
6wav16, _ = librosa.load("my.wav", sr=16000, mono=True) # encoder ingests 16 kHz mono
7x = torch.from_numpy(wav16).float().view(1, 1, -1).cuda()
8with torch.no_grad():
9 codes = model.encode_code(x) # frozen FSQ codes — 0.8 kbps, 50 tok/s
10 wav44 = model.decode_code(codes) # 44.1 kHz reconstruction| file | what |
|---|---|
pytorch_model.bin | decoder weights for inference (load with NeuCodec._from_pretrained(..., decoder_depth=20)) |
last.ckpt | full PyTorch-Lightning checkpoint with optimizer states + LR schedulers for resuming training |


| codec | native SR | tokens/s | codebooks | ~bitrate | UTMOSv2 | mel-L1 ↓ | HF≥11k | rolloff |
|---|---|---|---|---|---|---|---|---|
| ground truth | — | — | — | — | 2.822 | — | 0.00244 | 8263 |
| nvidia nemo44k | 44.1k | ~86 | RVQ (many) | ~6–9 kbps | 2.903 | 0.379 | 0.00196 | 8372 |
| WideCodec (ours, 2026-08-16) | 44.1k | 50 | 1 | ~0.8 kbps | 2.919 | 0.571 | 0.00223 | 9011 |
| WideCodec (previous, 2026-07-21) | 44.1k | 50 | 1 | ~0.8 kbps | 2.788 | 0.571 | 0.00223 | 9011 |
| dac | 44.1k | 86 | 9 | ~8 kbps | 2.672 | 0.341 | 0.00156 | 8185 |
| snac44k | 44.1k | multi-scale | 3–4 | ~2.6 kbps | 2.340 | 0.493 | 0.00158 | 8402 |
| encodec48k | 48k | 150 | RVQ | 24 kbps | 2.042 | 0.458 | 0.00169 | 8800 |
levels=[4]×8, num_quantizers=1 → 8·log₂4 = 16 bits/frame × 50 frames/s = 800 bps = 0.8 kbps
(vs DAC's 9 codebooks × 10 bits × 86 fps ≈ 8 kbps).main always points at the latest stage.| stage | data | how to load |
|---|---|---|
Stage 1 — noisy mix (steps 0→1.58M, epoch=9-step=1580000) | 8 base corpora + scale44k (~6,500 h, mostly noisy crowdsourced/podcast) | pin revision d2c612f4319c1c1e0c65a9431a7d6db1b7955ce0 |
| Stage 2 — clean finetune (from 1.58M, clean ≥44.1 kHz only; in progress) | TTS-Clean44k + Clean-Podcast + clean-teacher pool + EARS/Expresso | main (default) |
1# the `neucodec/` package is bundled in this repo (see 'Inference (self-contained)')
2from neucodec import NeuCodec
3
4# Stage 1 (first-stage noisy training) — pin the exact revision:
5model = NeuCodec._from_pretrained(
6 model_id="Scicom-intl/WideCodec",
7 decoder_depth=20,
8 revision="d2c612f4319c1c1e0c65a9431a7d6db1b7955ce0",
9)| dataset | content |
|---|---|
malaysia-ai/malaysian-podcast-youtube | Malay long-form conversational podcasts (~2,234 h) |
malaysia-ai/singaporean-podcast-youtube | Singaporean English podcasts (~1,255 h) |
malaysia-ai/Multilingual-TTS | CommonVoice-sidon multilingual short clips |
malaysia-ai/malaysian-cartoons-youtube | 48 kHz cartoon dialogue (subset) |
malaysia-ai/malaysian-movie-youtube | 48 kHz Malay movie dialogue |
ylacombe/expresso | 48 kHz expressive read speech |
nytopop/expresso-conversational | 48 kHz improvised dialogue |
| EARS | 48 kHz anechoic fullband (emotional / conversational / reading) |
<name>*audio.zip in malaysia-ai/Multilingual-TTS
and SR-verified ≥ 44 kHz. Original sources:1rsh/gujarati-f-openslr — 48000 HzAashish17405/audio-dataset — 48000 HzAashish17405/audio-dataset-300 — 48000 HzAashish17405/audio-dataset-shuffled-300 — 48000 HzAbdullah500/IndicTTS-Bengali — 48000 HzAbdullah500/IndicTTS_BengaliOLD — 48000 Hzadalat-ai/in22-legal — 48000 Hzahmadafaneh/common-voice-18-arabic — 48000 HzAIDC-AI/CSEMOTIONS — 48000 HzAJosh/audio-dataset — 48000 Hzalexantonov/chuvash_voice — 48000 Hzaliyzd95/common_voice_21_0_fa — 48000 Hzaliyzd95/common_voice_22_0_fa — 48000 Hzanian0707/hindi-tts-dataset — 48000 Hzatlithor/talromur3_with_prompts — 48000 Hzatlithor/talromur3_without_emotions — 48000 Hzbilguun/cv-mn-24.0 — 48000 Hzbookbot/slr72_dataset — 48000 HzChingkheinganba/IndicTTS_Manipuri — 48000 Hzchuuhtetnaing/myanmar-speech-dataset-openslr-80 — 48000 HzCnam-LMSSC/vibravox_enhanced_by_EBEN — 48000 HzCraneAILabs/waxal-lug-clean — 48000 Hzdatahiveai/arabic-multidialect-emotional-speech-demo — 48000 HzDatarrX/burmese-synthetic-speech-corpus — 48000 HzDDD-Cambodia/khm-asr-cultural — 48000 Hzdeepdml/igbo-dict — 48000 Hzdeepdml/igbo-dict-16khz — 48000 Hzdeepdml/igbo-dict-expansion — 48000 Hzdeepdml/igbo-dict-expansion-16khz — 48000 Hzdeepdml/openslr-32-hq-SA-languages — 48000 Hzdeepdml/openslr42-khmer-tts — 48000 Hzdeepdml/openslr65-tamil — 48000 Hzdeepdml/openslr80-burmese — 48000 Hzdoof-ferb/fpt_fosd — 48000 Hzdoof-ferb/infore1_25hours — 48000 Hzespnet/ace-kising-segments — 48000 Hzespnet/ace-opencpop-segments — 48000 HzFatimahEmadEldin/alsanaa-emirati-arabic-asr — 48000 Hzfluffypotatoes/f1-team-radio — 48000 Hzfosters/lagodny-tsmok-iury-zhygamont-output_original — 48000 Hzfosters/lagodny-tsmok-iury-zhygamont_all — 48000 Hzgauravparajuli/slr43 — 48000 Hzggfox00000/stt-summre-fr-test — 48000 Hzggfox00000/stt-vibravox-fr-test — 48000 Hzhanamizuki-ai/genshin-voice-v3.3-mandarin — 48000 Hzhanamizuki-ai/genshin-voice-v3.4-mandarin — 48000 Hzhanamizuki-ai/genshin-voice-v3.5-mandarin — 48000 HzHeshamHaroon/arabic-msa-25k-saudi-male-tashkeel — 48000 HzHeshamHaroon/Dahee7 — 48000 Hzhezarai/common-voice-13-fa — 48000 Hzhosein-m/french_homophone_asr — 48000 Hzhumyn-labs/Asian-High-Fidelity-ASR-Dataset — 48000 Hzhumyn-labs/LATAM-High-Fidelity-ASR — 48000 Hzhypaai/Hypa-Speech-10k — 48000 Hzhypaai/Hypa_Fleurs — 48000 Hzigidn/wuwa-voice-EN — 48000 Hzimpriyanshu-garg00/IndicVoices-R_Hindi — 48000 HzJacobLinCool/jl-speech — 48000 HzJeanKouss/ewe_bible_v2_tts — 48000 Hzjspaulsen/vctk — 48000 Hzjuanjucm/OpenHQ-SpeechT-GL-EN — 48000 Hzjzsues/genshin-voice-zh — 48000 HzKishor798/text_to_speech_dataset — 48000 HzKppwdfgu1/Hypa-Speech-10k — 48000 HzKrorngAI/fleurs_openslr42_mpwt — 48000 HzKukedlc/openslr61-es-ar-full — 48000 Hzleduckhai/MultiMed — 48000 Hzleduckhai/MultiMed-ST — 48000 HzLeVy4/speech-to-text — 48000 Hzlilgoose777/nepali_speech_english_translation_shuffle_dataset — 48000 HzLindarychwalski/pony-speech — 48000 Hzlonghim99/khm-asr-cultural — 48000 Hzlyhourt-FSA/khm-asr-cultural — 48000 Hzmaikezu/dowis — 48000 Hzmanassehzw/sna-manasseh-150-raw — 48000 Hzmasuidrive/cv-corpus-17.0-zh-TW-client_id-grouped — 48000 HzMatrixStudio/TTS-CCabNavMSC — 48000 HzMatrixStudio/TTS-CFCabNavSC — 48000 HzMatrixStudio/TTS-SCCusSerFSC — 48000 HzMatrixStudio/TTS-SCDuFSC — 48000 HzMax5ive/openslr-32-hq-SA-languages-Sesotho — 48000 Hzmazesmazes/jenny-mimi — 48000 HzMikCil/f1-team-radio — 48000 Hzmohamedmou/DATASET-darija-ASR-clean — 48000 HzMohamedRashad/arabic-english-code-switching — 48000 HzMohamedRashad/common-voice-18-arabic — 48000 Hzngia/ASR_pulaar — 48000 Hzntaquan0125/steinsgate-voice — 48000 Hzntt123/VietBibleVox-aligned — 48000 HzOmarAhmedSobhy/egyption-with-emotion-dataset — 48000 HzOmarAhmedSobhy/tts-egyption-dataset — 48000 Hzomersaidd/tts_ahmet_deniz_tur — 48000 Hzrahafvii/EGY2K — 48000 Hzranbirchabungbam/meiteimayek-audio-parallel-corpus — 48000 Hzreapzor/neurologySTT — 48000 HzRikkaBotan/nyan-jenny-format — 48000 HzRobotsMali/transcription-scorer — 48000 HzSachinTelecmi/tts-hindi-stts2 — 48000 Hzsartifyllc/Sukuma-Voices — 48000 Hzscriptaudio/f1-team-radio — 48000 Hzsdcsdccdsd/CSEMOTIONS — 48000 Hzshoron08/irodori-refs-10k — 48000 Hzshreeshacharya/Dhravani — 48000 Hzsiddiqiya/ar-eg-dataset — 48000 Hzslprl/StressTest — 48000 Hzsmcproject/MSC — 48000 Hzsomu9/iisc_mono_hindi_female — 48000 Hzsomu9/iitm_mono_hindi_female — 48000 Hzspeech-uk/opentts-kateryna — 48000 Hzspeech-uk/opentts-oleksa — 48000 Hzspeech-uk/opentts-tetiana — 48000 Hzspeech-uk/tts-crh-abibullah — 48000 Hzspeech-uk/tts-crh-arslan — 48000 Hzspeech-uk/tts-crh-sevil — 48000 HzSPRINGLab/IndicTTS-Hindi — 48000 HzSPRINGLab/IndicTTS_Assamese — 48000 HzSPRINGLab/IndicTTS_Bengali — 48000 HzSPRINGLab/IndicTTS_Kannada — 48000 HzSPRINGLab/IndicTTS_Malayalam — 48000 HzSPRINGLab/IndicTTS_Manipuri — 48000 HzSPRINGLab/IndicTTS_Marathi — 48000 HzSPRINGLab/IndicTTS_Odia — 48000 HzSPRINGLab/IndicTTS_Punjabi — 48000 HzSPRINGLab/IndicTTS_Rajasthani — 48000 HzSPRINGLab/IndicTTS_Tamil — 48000 HzSPRINGLab/IndicVoices-R_Hindi — 48000 Hzsrezas/farsi_voice_dataset — 48000 HzSynDataLab-JA-Refs/Irodori-Ja-Spk1-10k — 48000 HzSynDataLab-JA-Refs/Irodori-Ja-Spk2-10k — 48000 HzSynDataLab-JA-Refs/Irodori-Ja-Spk3-10k — 48000 HzSynDataLab-JA-Refs/Irodori-Ja-Spk4-10k — 48000 HzSynDataLab-JA-Refs/irodori-refs-10k — 48000 HzSynDataLab-JA-Refs/irodori-refs-10k-v2 — 48000 HzSynDataLab-JA-Refs/irodori-tts-refs-12k — 48000 HzSynDataLab-JA/Irodori-Ja-500M-v2-vs-600M-v3-compare-20 — 48000 Hzsynthbot/pony-singing — 48000 Hzsynthbot/pony-speech — 48000 HzTamazight-NLP/TOSD — 48000 Hzthennal/GMaSC — 48000 Hzthennal/indic_tts_ml — 48000 Hzthennal/msc — 48000 HzTrelis/multimed-hard — 48000 Hztrysem/indicvoices_r-ML — 48000 Hzttthe/MultiMed — 48000 Hztunis-ai/arabic_speech_corpus — 48000 Hzvinaybabu/voice_tech_for_all_challenge_samples_output — 48000 Hzvoice-biomarkers/openslr-32-hq-SA-languages-Afrikaans — 48000 Hzvoice-biomarkers/openslr-32-hq-SA-languages-isiXhosa — 48000 Hzvoice-biomarkers/openslr-32-hq-SA-languages-Sesotho — 48000 Hzvoice-biomarkers/openslr-32-hq-SA-languages-Setswana — 48000 Hzvrclc/openslr63 — 48000 Hzwanasash/enwaucymraeg — 48000 Hzworldboss/ewe_bible_v2_tts — 48000 Hzworldboss/twi_bible_v2_tts — 48000 Hzyasalma/tat_hackathon_asr — 48000 HzYehor/qirimtatar-tts — 48000 Hzylacombe/english_dialects — 48000 Hzylacombe/google-chilean-spanish — 48000 Hzylacombe/google-tamil — 48000 Hzymoslem/CoVoST2-EN-AR — 48000 Hzymoslem/Living-Audio-Irish — 48000 Hzzinc75/Vibravox_dummy — 48000 Hz8Opt/clotho-dev-sample — 44100 Hzaangelakis/STOMA — 44100 Hzadiren7/darija_speech_to_text — 44100 Hzahmed220v/SCC22 — 44100 HzAigizK/bashkort_tts_dataset — 44100 Hzaipanjab/speech-mendeley-pa — 44100 HzALEKAS/ToneBooksPlus-Grigorii — 44100 Hzalimetin/turkish-parliament-speech — 44100 Hzamine-khelif/DuBLaB-en-fr-0.7 — 44100 Hzamine-khelif/DuBLaB-en-fr-0.7-f-0.2 — 44100 Hzamine-khelif/DuBLaB-en-fr-0.7-f-0.5 — 44100 Hzamine-khelif/DuBLaB-en-fr-0.8 — 44100 HzAnilosan15/YouTube_Video_Transkriptleri_TR — 44100 HzAnonXx/Pidgin_ASR_Dataset_Combined — 44100 Hzanzorq/kbd_speech — 44100 Hzarchivartaunik/Jevanhielle_Zyhamont_outChecked — 44100 Hzarchivartaunik/output4Checked — 44100 HzBateesa/rw-tts-dataset — 44100 Hzberatcmn/jessica-076 — 44100 Hzbezzam/coraal — 44100 HzBretagne/Lingua_Libre_br — 44100 HzBrunoHays/Bangor-Miami-Spanish-English-Corpus — 44100 Hzcagataydev/vlm-voice-audio — 44100 HzCentificAIResearch/DialectalSpeech-ICL — 44100 Hzchangelinglab/speechaccentarchive-pr — 44100 Hzchris-t-jansen/erasmian_greek_nt — 44100 HzCodyfederer/fttrtest — 44100 HzCodyfederer/test3434234 — 44100 HzCodyfederer/tretret34543 — 44100 HzCoRal-project/coral-tts — 44100 Hzcorti/med-term — 44100 Hzctaguchi/killkan — 44100 Hzczyzi0/pwr-azon-speech-dataset — 44100 Hzczyzi0/the-mc-speech-dataset — 44100 HzD00Movenok/russian-glados-portal2 — 44100 Hzdaanbrugmans/ovb-huissen-1 — 44100 Hzdata-lab-voice/echo-tts-en-benchmarks-v1 — 44100 HzDataStudio/Vietnamese_ASR_TestingData_Old — 44100 HzEMINES/Tamazight-Speech-to-Arabic-Text — 44100 Hzfablevi/one_voice_FACEBOOK_PARQUET — 44100 Hzfarbodbij/persian-words — 44100 Hzfiifinketia/twi-trigrams-speech-text-parallel — 44100 Hzfosters/ales-krautsevich-karotkaia-gistoryia-belarusi-uladzimir-lisouski-output_original — 44100 Hzfosters/ales-krautsevich-karotkaia-gistoryia-belarusi-uladzimir-lisouski_all — 44100 Hzfosters/ales_razanau_all — 44100 Hzfosters/ales_razanau_output_original — 44100 Hzfosters/ales_zhuk_praklytaya_lyubow_all — 44100 Hzfosters/ales_zhuk_praklytaya_lyubow_output_original — 44100 Hzfosters/anatol_vyartsinski_pesnya_pra_hleb_all — 44100 Hzfosters/anatol_vyartsinski_pesnya_pra_hleb_output_original — 44100 Hzfosters/andre_marua_pakaranne_zolatam_all — 44100 Hzfosters/andre_marua_pakaranne_zolatam_output_original — 44100 Hzfosters/Antuan_de_Sent-Ekziupiery_Planieta_ludziei_all — 44100 Hzfosters/Antuan_de_Sent-Ekziupiery_Planieta_ludziei_output_original — 44100 Hzfosters/astryd_lindgren_braty_lvinae_sertsa_all — 44100 Hzfosters/astryd_lindgren_braty_lvinae_sertsa_output_original — 44100 Hzfosters/bely_klyck_all — 44100 Hzfosters/dzhozef_redzyard_kipling_all — 44100 Hzfosters/dzhozef_redzyard_kipling_output_original — 44100 Hzfosters/dzintra_shultse_robertsik_all — 44100 Hzfosters/dzintra_shultse_robertsik_output_original — 44100 Hzfosters/ernest_heminguei_stary_chalavek_i_mora_all — 44100 Hzfosters/ernest_heminguei_stary_chalavek_i_mora_output_original — 44100 Hzfosters/eryh_maryya_remark_all — 44100 Hzfosters/eryh_maryya_remark_output_original — 44100 Hzfosters/eryh_raspe_prygody_barona_myunhau_zena_all — 44100 Hzfosters/eryh_raspe_prygody_barona_myunhau_zena_output_original — 44100 Hzfosters/genadz_pashkou_all — 44100 Hzfosters/genadz_pashkou_output_original — 44100 Hzfosters/iagan_frydryh_shyler_kubak_all — 44100 Hzfosters/iagan_frydryh_shyler_kubak_output_original — 44100 Hzfosters/iakub-kolas-kazki-zhytstsia-output_original — 44100 Hzfosters/iakub-kolas-kazki-zhytstsia_all — 44100 Hzfosters/ivan-melezh-podykh-navalnitsy-valer-budzevich-output_original — 44100 Hzfosters/ivan-melezh-podykh-navalnitsy-valer-budzevich_all — 44100 Hzfosters/ivan-melezh-zavei-snezhan-valer-budzevich-output_original — 44100 Hzfosters/ivan-melezh-zavei-snezhan-valer-budzevich_all — 44100 Hzfosters/ivan-navumenka-zhul-vern-output_original — 44100 Hzfosters/ivan-navumenka-zhul-vern_all — 44100 Hzfosters/ivan-ptashnikau-lvy-output_original — 44100 Hzfosters/ivan-ptashnikau-lvy_all — 44100 Hzfosters/ivan_navumenka_sasna_pry_daroze_all — 44100 Hzfosters/ivan_navumenka_sasna_pry_daroze_output_original — 44100 Hzfosters/ivan_ptashnikau_all — 44100 Hzfosters/ivan_ptashnikau_output_original — 44100 Hzfosters/ivan_shamyakin_sertsa_na_daloni_all — 44100 Hzfosters/ivan_shamyakin_sertsa_na_daloni_output_original — 44100 Hzfosters/ivan_shamyakin_tryvozhnae_shchastse_all — 44100 Hzfosters/ivan_shamyakin_tryvozhnae_shchastse_output_original — 44100 Hzfosters/knihi-be-arlou_tancy_nad_horadam_all — 44100 Hzfosters/knihi-be-arlou_tancy_nad_horadam_output_original — 44100 Hzfosters/kuzma_chorny_makarkavyh_volka_all — 44100 Hzfosters/kuzma_chorny_makarkavyh_volka_output_original — 44100 Hzfosters/kuzma_chorny_poshuki_buduchyni_all — 44100 Hzfosters/kuzma_chorny_poshuki_buduchyni_output_original — 44100 Hzfosters/kuzma_chorny_zyamlya_all — 44100 Hzfosters/kuzma_chorny_zyamlya_output_original — 44100 Hzfosters/legendy-i-padanni_all — 44100 Hzfosters/legendy-i-padanni_original — 44100 Hzfosters/maksim_tank_all — 44100 Hzfosters/maksim_tank_output_original — 44100 Hzfosters/mar_yan_duksa_all — 44100 Hzfosters/mar_yan_duksa_output_original — 44100 Hzfosters/raisa_baravikova_vasmiradkou_i_all — 44100 Hzfosters/raisa_baravikova_vasmiradkou_i_output_original — 44100 Hzfosters/raisa_baravikova_vershy_pra_kahanne_all — 44100 Hzfosters/raisa_baravikova_vershy_pra_kahanne_output_original — 44100 Hzfosters/shata_rustaveli_vitsyaz_u_tygravai_shkury_all — 44100 Hzfosters/shata_rustaveli_vitsyaz_u_tygravai_shkury_output_original — 44100 Hzfosters/stefan_tsvei_g_nyabachnaya_kalektsyya_all — 44100 Hzfosters/stefan_tsvei_g_nyabachnaya_kalektsyya_output_original — 44100 Hzfosters/taras_shau_chenka_vershy_paemy_all — 44100 Hzfosters/taras_shau_chenka_vershy_paemy_output_original — 44100 Hzfosters/uilyam_folkner_pah_verbeny_all — 44100 Hzfosters/uilyam_folkner_pah_verbeny_output_original — 44100 Hzfosters/uladzimir-karatkevich-dzikae-paliavanne-karalia-stakha-aleg-garbuz-output_original — 44100 Hzfosters/uladzimir-karatkevich-dzikae-paliavanne-karalia-stakha-aleg-garbuz_all — 44100 Hzfosters/vasil_bykau_all — 44100 Hzfosters/vasil_bykau_output_original — 44100 Hzfosters/vasil_zue_nok_syaliba_all — 44100 Hzfosters/vasil_zue_nok_syaliba_output_original — 44100 Hzfosters/viktar_prau_dzin_all — 44100 Hzfosters/viktar_prau_dzin_output_original — 44100 Hzfosters/yakub_kolas_novaya_zyamlya_all — 44100 Hzfosters/yakub_kolas_novaya_zyamlya_output_original — 44100 Hzfosters/yanka_bryl_ptushki_i_gne_zdy_all — 44100 Hzfosters/yanka_bryl_ptushki_i_gne_zdy_output_original — 44100 Hzfosters/yanka_sipakou_odzium_all — 44100 Hzfosters/yanka_sipakou_odzium_output_original — 44100 HzfutureDoctor/turkic_tts_dataset — 44100 Hzghananlpcommunity/asante-twi-bible-speech-phonemes — 44100 Hzghananlpcommunity/twi-trigrams-speech-text-parallel — 44100 Hzgrandhigh/sample-id — 44100 Hzgrider-transwithai/nekopara-speech — 44100 Hzhananeek2/STT-algerian-dialect — 44100 Hzhhim8826/japanese-anime-speech-v2-split — 44100 Hzhumairawan/AnimeSpeech — 44100 Hzjdapaah/asante-twi-bible — 44100 Hzjoujiboi/kuroyukihime-speech — 44100 Hzkizuna-intelligence/AItuber-Persona-Voices-JA — 44100 Hzlangswap/dialogs-ru-emotional-conversations — 44100 HzMatrixStudio/TTS-SCFChilSC — 44100 Hzmetricv/tl-whisper — 44100 HzMichel21/rick-sanchez — 44100 HzMikhailT/hifi-tts — 44100 HzMohamedRashad/SCC22 — 44100 HzMothersTongue/mother_tongue_dataset — 44100 Hzmsnowchanj/pvariant-EQ — 44100 HzPragmaticl/Trys2 — 44100 HzPragmaticl/TuyenVanHoa2 — 44100 HzPragmaticl/TuyenVanHoa4 — 44100 HzProfessor/kinyarwanda-tts-dataset-kin — 44100 Hzray0rf1re/GLaDOS-audio-v2 — 44100 Hzsachin6624/malayalam-tts-pro-voice — 44100 Hzshannonnonshan/ViMedCSS-Cop — 44100 HzShoukanLabs/AniSpeech — 44100 HzSoufianeDahimi/Tamazight-ASR-Dataset-v2 — 44100 Hzsudoping01/bam-asr-benchmark — 44100 HzSynDataLab-EN-Refs/echo-ref-speakers-4k-en — 44100 HzSynDataLab-EN-Refs/tts-pretrain-refs-3k-mos — 44100 HzSynDataLab-EN/EchoTTS-OmniVoice-En — 44100 Hztensorxt/ViMedCSS — 44100 HzThorsten-Voice/TV-44kHz-Full — 44100 Hztimniel/Pidgin_ASR_Dataset_Combined — 44100 Hztrysem/malayalam-tts-pro-voice — 44100 HzTutlaytAI/kabyle_asr — 44100 HzTutlaytAI/Kabyle_ASR-En_Translation — 44100 HzTutlaytAI/Kabyle_ASR-Fr_Translation — 44100 Hzvsisik/voice-dataset-lili — 44100 Hzwcwxyz/test-audio — 44100 HzWhissleAI/Meta_STT_ZH_AIShell3 — 44100 Hzyasalma/audiobooks — 44100 Hzymoslem/BitesizeIrish-GA-EN — 44100 Hzyuriilaba/toronto-tv-ukrainian — 44100 Hzdecoder_depth=20 is required — the weights are a
depth-20 decoder, so loading with any other depth mismatches the architecture.1import soundfile as sf
2
3# the `neucodec/` package is bundled in this repo (see 'Inference (self-contained)')
4from neucodec import NeuCodec
5
6# decoder_depth=20 MUST match this repo; pass token=... (or hf login) for access
7model = NeuCodec._from_pretrained(model_id="Scicom-intl/WideCodec", decoder_depth=20)
8model = model.eval().cuda()
9
10# encode (16 kHz path, frozen) -> codes -> decode (44.1 kHz, this finetune)
11codes = model.encode_code("input.wav") # [1, 1, T], identical to base NeuCodec
12recon_44k = model.decode_code(codes).squeeze().cpu().numpy()
13sf.write("recon.wav", recon_44k, model.sample_rate) # 44100neuphonic/neucodec — only the reconstruction
sample rate and fidelity differ.