Views
No views yet
Wav2Vec2ForCTC1import torch
2import librosa
3from transformers import Wav2Vec2Processor, Wav2Vec2ForCTC
4
5processor = Wav2Vec2Processor.from_pretrained("dysata/Wav2Vec2-Ru-Child")
6model = Wav2Vec2ForCTC.from_pretrained("dysata/Wav2Vec2-Ru-Child")
7
8audio, sr = librosa.load("audio.wav", sr=16000)
9
10processed = processor([audio], sampling_rate=16000,
11 return_tensors="pt", padding="longest")
12
13with torch.no_grad():
14 logits = model(processed.input_values,
15 attention_mask=processed.attention_mask).logits
16
17predicted_ids = torch.argmax(logits, dim=-1)
18transcription = processor.decode(predicted_ids[0])
19print(transcription)1with torch.no_grad():
2 outputs = model(processed.input_values,
3 attention_mask=processed.attention_mask,
4 output_hidden_states=True, return_dict=True)
5 last_hidden_state = outputs.hidden_states[-1] # [batch, frames, 1024]| Parameter | Value |
|---|---|
| Sample rate | 16 kHz |
| Feature extractor | 7-layer CNN |
| Transformer layers | 24 |
| Hidden size | 1024 |
| Vocab size | 37 |
| Precision | float32 |
| Format | Safetensors |
<pad>, <s>, </s>, <unk>, | (разделитель слов), а-я (33 буквы русского алфавита).1@misc{wav2vec2-ru-child,
2 author = {Павел Рудич},
3 title = {Wav2Vec2-Ru-Child: Russian Children's Speech Recognition Model},
4 year = {2025},
5 publisher = {Hugging Face},
6 url = {https://huggingface.co/dysata/Wav2Vec2-Ru-Child}
7}