Views
No views yet
1pip install git+https://github.com/huggingface/parler-tts.git
2pip install git+https://github.com/getuka/RubyInserter.git1import torch
2from parler_tts import ParlerTTSForConditionalGeneration
3from transformers import AutoTokenizer
4import soundfile as sf
5from rubyinserter import add_ruby
6
7device = "cuda:0" if torch.cuda.is_available() else "cpu"
8
9model = ParlerTTSForConditionalGeneration.from_pretrained("2121-8/japanese-parler-tts-mini-bate").to(device)
10tokenizer = AutoTokenizer.from_pretrained("2121-8/japanese-parler-tts-mini-bate")
11
12prompt = "こんにちは、今日はどのようにお過ごしですか?"
13description = "A female speaker with a slightly high-pitched voice delivers her words at a moderate speed with a quite monotone tone in a confined environment, resulting in a quite clear audio recording."
14
15
16prompt = add_ruby(prompt)
17input_ids = tokenizer(description, return_tensors="pt").input_ids.to(device)
18prompt_input_ids = tokenizer(prompt, return_tensors="pt").input_ids.to(device)
19
20generation = model.generate(input_ids=input_ids, prompt_input_ids=prompt_input_ids)
21audio_arr = generation.cpu().numpy().squeeze()
22sf.write("parler_tts_japanese_out.wav", audio_arr, model.config.sampling_rate)