Views
No views yet
train.py (Accelerate + GAN / WavLM-related losses per config)dataset.py (multi-domain mixing; loads audio paths from scp)infer.py (reconstructs audio with a pretrained checkpoint)config/config_omnicodec.yamlpip install -r requirements.txtrequirements.txt contains an editable install line -e OmniCodec/transformers-main. Make sure the referenced path exists in your environment, or adjust/remove that line if you already have transformers installed.utt_id /abs/or/rel/path/to/audio.wav/abs/or/rel/path/to/audio.wav (utt will be inferred from filename)1utt0001 /data/speech/utt0001.wav
2utt0002 /data/speech/utt0002.wavdataset.py will:librosa.load(..., sr=sample_rate, mono=True)librosa.util.normalize(wav) * 0.95segment_size (default: 240000 samples @ 24kHz = 10s){"wav": Tensor[T], "utt": str, "text": None}None and are filtered by collate_fn in train.py.config/config_omnicodec.yaml:data.speech_train_shards_dir: path to speech.scpdata.music_train_shards_dir: path to music.scpdata.sound_train_shards_dir: path to sound.scpdata.sample_rate: default 24000data.segment_size: default 240000model.wavlmloss.ckpt_path: default pretrain_model/ssl/wavlm-base-pluswav_lm_model: default pretrain_model/ssl/wavlm_model/wavlmtrain.save_dir: default ./exps/omnicodecpython train.py -c config/config_omnicodec.yamltrain.save_dir (default: ./exps/omnicodec).infer.py loads the checkpoint from:pretrained_model/omnicodec.pthinfer.py to point to your checkpoint)../testset/speech/python infer.py -c config/config_omnicodec.yaml./outputs/1.
2├─ config/
3│ └─ config_omnicodec.yaml
4├─ dataset.py
5├─ train.py
6├─ infer.py
7├─ models/
8├─ modules/
9├─ quantization/
10├─ discriminators/
11├─ losses/
12├─ utils/
13└─ requirements.txt1@misc{hu2026omnicodeclowframerate,
2 title={OmniCodec: Low Frame Rate Universal Audio Codec with Semantic-Acoustic Disentanglement},
3 author={Jingbin Hu and Haoyu Zhang and Dake Guo and Qirui Zhan and Wenhao Li and Huakang Chen and Guobin Ma and Hanke Xie and Chengyou Wang and Pengyuan Xie and Chuan Xie and Qiang Zhang and Lei Xie},
4 year={2026},
5 eprint={2603.20638},
6 archivePrefix={arXiv},
7 primaryClass={eess.AS},
8 url={https://arxiv.org/abs/2603.20638},
9}