Views
No views yet
pip install torch torchaudio transformers huggingface_hub safetensors soundfile numpy pyyaml typeguard1import torchaudio
2from transformers import AutoModel
3
4model = AutoModel.from_pretrained(
5 "changelinglab/PhoneticXeus", trust_remote_code=True
6).eval()
7
8wav, sr = torchaudio.load("audio.wav")
9wav = wav.mean(0) # mono, shape (samples,)
10if sr != 16000:
11 wav = torchaudio.functional.resample(wav, sr, 16000)
12
13print(model.transcribe(wav, sampling_rate=16000)[0]["processed_transcript"])
14# e.g. "aɪhædðætkʰjʊɹiɑsətipɪsaɪd…"model.transcribe(...) returns a list of dicts with processed_transcript
(joined IPA) and predicted_transcript (slash-separated phones). Calling
model(input_values) returns frame-level CTC logits (batch, frames, 428)
for custom decoding.trust_remote_code=True).1@misc{pxeus26,
2 title={An Empirical Recipe for Universal Phone Recognition},
3 author={Shikhar Bharadwaj and Chin-Jou Li and Kwanghee Choi and Eunjung Yeo and William Chen and Shinji Watanabe and David R. Mortensen},
4 year={2026},
5 eprint={2603.29042},
6 archivePrefix={arXiv},
7 primaryClass={cs.CL},
8 url={https://arxiv.org/abs/2603.29042},
9}