Views
No views yet
openai/whisper-large-v3-turbo 微調而來,專門用於辨識日本動漫中的語音內容。它經過 hhim8826/japanese-anime-speech-v2-split 資料集訓練,能夠更好地處理動漫語音的特點,包括特殊的語調、語氣和常見的動漫用語。1from transformers import pipeline
2
3asr = pipeline("automatic-speech-recognition", model="hhim8826/whisper-large-v3-turbo-ja")
4
5# 使用音訊檔案進行轉錄
6result = asr("path/to/anime_audio.wav")
7print(result["text"])1from transformers import AutoProcessor, AutoModelForSpeechSeq2Seq
2import torch
3import librosa
4
5# 載入模型和處理器
6processor = AutoProcessor.from_pretrained("hhim8826/whisper-large-v3-turbo-ja")
7model = AutoModelForSpeechSeq2Seq.from_pretrained("hhim8826/whisper-large-v3-turbo-ja").to("cuda")
8
9# 載入音訊檔案
10audio_file = 'anime_audio.wav'
11audio_array, sampling_rate = librosa.load(audio_file, sr=16000)
12
13# 處理音訊輸入
14inputs = processor(audio_array, sampling_rate=16000, return_tensors="pt").to("cuda")
15
16# 進行推論
17with torch.no_grad():
18 generated_ids = model.generate(inputs=inputs.input_features)
19
20# 解碼輸出
21transcription = processor.batch_decode(generated_ids, skip_special_tokens=True)[0]
22print(transcription)hhim8826/japanese-anime-speech-v2-split 資料集進行訓練,該資料集包含來自各種日本動漫的語音片段及其對應的文字轉錄。openai/whisper-large-v3-turbo 開始,經過微調以適應動漫語音的特點。訓練在適當的迭代次數後停止,避免過擬合。