Views
No views yet
pip install ctc_forced_alignerpip install ctc_forced_aligner[gpu]pip install ctc_forced_aligner[torch]pip install ctc_forced_aligner[all]1from ctc_forced_aligner import AlignmentSingleton
2alignment_service = AlignmentSingleton()
3input_audio_path = "audio.mp3"
4input_text_path = "input.txt"
5output_srt_path = "output.srt"
6ret = alignment_service.generate_srt(input_audio_path,
7 input_text_path,
8 output_srt_path)
9if ret:
10 print(f"Aligned SRT is generated at {output_srt_path}")
11output_vtt_path = "output.vtt"
12ret = alignment_service.generate_webvtt(input_audio_path,
13 input_text_path,
14 output_vtt_path)
15if ret:
16 print(f"aligned VTT is generated to {output_vtt_path}")1from ctc_forced_aligner import AlignmentTorch
2at = AlignmentTorch()
3ret = at.generate_srt(input_audio_path, input_text_path, output_srt_path)
4if ret:
5 print(f"aligned srt is generated to {output_srt_path}")
6ret = at.generate_webvtt(input_audio_path, input_text_path, output_vtt_path)
7if ret:
8 print(f"aligned VTT is generated to {output_vtt_path}")1from ctc_forced_aligner import AlignmentTorch
2at = AlignmentTorch()
3ret = at.generate_srt(input_audio_path, input_text_path, output_srt_path, model_type='WAV2VEC2_ASR_BASE_960H')
4if ret:
5 print(f"aligned srt is generated to {output_srt_path}")
6ret = at.generate_webvtt(input_audio_path, input_text_path, output_vtt_path, model_type='WAV2VEC2_ASR_BASE_960H')
7if ret:
8 print(f"aligned VTT is generated to {output_vtt_path}")WAV2VEC2_ASR_BASE_960HWAV2VEC2_ASR_BASE_100HWAV2VEC2_ASR_BASE_10MWAV2VEC2_ASR_LARGE_10MWAV2VEC2_ASR_LARGE_100HWAV2VEC2_ASR_LARGE_960HWAV2VEC2_ASR_LARGE_LV60K_10MWAV2VEC2_ASR_LARGE_LV60K_100HWAV2VEC2_ASR_LARGE_LV60K_960HVOXPOPULI_ASR_BASE_10K_DE (German ASR)VOXPOPULI_ASR_BASE_10K_EN (English ASR)VOXPOPULI_ASR_BASE_10K_ES (Spanish ASR)VOXPOPULI_ASR_BASE_10K_FR (French ASR)VOXPOPULI_ASR_BASE_10K_IT (Italian ASR)HUBERT_ASR_LARGEHUBERT_ASR_XLARGEAlignmentTorch or AlignmentTorchSingleton.WAV2VEC2_ASR_LARGE_960H or HUBERT_ASR_LARGEVOXPOPULI_ASR_BASE_10K_*WAV2VEC2_ASR_BASE_10M (smallest model)WAV2VEC2_ASR_LARGE_LV60K_960H or HUBERT_ASR_XLARGEAlignment or AlignmentSingleton.BSD-2-Clause license.BSD license.This project is licensed under the BSD License, note that the default model has CC-BY-NC 4.0 License, so make sure to use a different model for commercial usage.MIT License and redistributed with the same license.
WAV2VEC2_ASR_BASE_960HWAV2VEC2_ASR_BASE_100HWAV2VEC2_ASR_BASE_10MWAV2VEC2_ASR_LARGE_10MWAV2VEC2_ASR_LARGE_100HWAV2VEC2_ASR_LARGE_960HWAV2VEC2_ASR_LARGE_LV60K_10MWAV2VEC2_ASR_LARGE_LV60K_100HWAV2VEC2_ASR_LARGE_LV60K_960HVOXPOPULI_ASR_BASE_10K_DEVOXPOPULI_ASR_BASE_10K_ENVOXPOPULI_ASR_BASE_10K_ESVOXPOPULI_ASR_BASE_10K_FRVOXPOPULI_ASR_BASE_10K_ITHUBERT_ASR_LARGEHUBERT_ASR_XLARGEMMS_FA is published by the authors of Scaling Speech Technology to 1,000+ Languages Pratap et al., 2023 under CC-BY-NC 4.0 License.CC-BY-NC 4.0 License.