This hub features the pre-trained model by DiariZen. The EEND component is built upon WavLM-Base+ and Conformer layers. The model was trained on far-field, single-channel audio data from the public datasets AMI, AISHELL-4, and AliMeeting. Please follow the instructions for before use.
Usage
python
1from diarizen.pipelines.inference import DiariZenPipeline
23# load pre-trained model4diar_pipeline = DiariZenPipeline.from_pretrained("BUT-FIT/diarizen-meeting-base")5# apply diarization pipeline6diar_results = diar_pipeline('audio.wav')78# print results9for turn, _, speaker in diar_results.itertracks(yield_label=True):10print(f"start={turn.start:.1f}s stop={turn.end:.1f}s speaker_{speaker}")1112# load pre-trained model and save RTTM result13diar_pipeline = DiariZenPipeline.from_pretrained(14"BUT-FIT/diarizen-meeting-base",15 rttm_out_dir='.'16)17# apply diarization pipeline18diar_results = diar_pipeline('audio.wav', sess_name='session_name')
@inproceedings{han2025leveraging,
title={Leveraging self-supervised learning for speaker diarization},
author={Han, Jiangyu and Landini, Federico and Rohdin, Johan and Silnova, Anna and Diez, Mireia and Burget, Luk{\'a}{\v{s}}},
booktitle={Proc. ICASSP},
year={2025}
}