Views
No views yet
1import pandas as pd
2from huggingsound import SpeechRecognitionModel
3
4model = SpeechRecognitionModel("Cnam-LMSSC/wav2vec2-french-phonemizer")
5audio_paths = ["./test_relecture_texte.wav", "./10179_11051_000021.flac"]
6
7# No need for the Audio files to be sampled at 16 kHz here,
8# they are automatically resampled by Huggingsound
9
10transcriptions = model.transcribe(audio_paths)
11
12# (Optionnal) Display results in a table :
13## transcriptions is list of dicts also containing timestamps and probabilities !
14
15df = pd.DataFrame(transcriptions)
16df['Audio file'] = pd.DataFrame(audio_paths)
17df.set_index('Audio file', inplace=True)
18df[['transcription']]| Audio file | Phonetic transcription (IPA) |
|---|---|
| ./test_relecture_texte.wav | ʃapitʁ di də abɛse pəti kɔ̃t də ʒyl ləmɛtʁ ɑ̃ʁʒistʁe puʁ libʁivɔksɔʁɡ ibis dɑ̃ la bas kuʁ dœ̃ ʃato sə tʁuva paʁmi tut sɔʁt də volaj œ̃n ibis ʁɔz |
| ./10179_11051_000021.flac | kɛl dɔmaʒ kə sə nə swa pa dy sykʁ supiʁa se foʁaz ɑ̃ pasɑ̃ sa lɑ̃ɡ syʁ la vitʁ fɛ̃ dy ʃapitʁ kɛ̃z ɑ̃ʁʒistʁe paʁ sonjɛ̃ sɛt ɑ̃ʁʒistʁəmɑ̃ fɛ paʁti dy domɛn pyblik |
1import torch
2from transformers import AutoModelForCTC, Wav2Vec2Processor
3from datasets import load_dataset
4import soundfile as sf # Or Librosa if you prefer to ...
5
6MODEL_ID = "Cnam-LMSSC/wav2vec2-french-phonemizer"
7
8model = AutoModelForCTC.from_pretrained(MODEL_ID)
9processor = Wav2Vec2Processor.from_pretrained(MODEL_ID)
10
11audio = sf.read('example.wav')
12# Make sure you have a 16 kHz sampled audio file, or resample it !
13
14inputs = processor(np.array(audio[0]),sampling_rate=16_000., return_tensors="pt")
15
16with torch.no_grad():
17 logits = model(**inputs).logits
18
19predicted_ids = torch.argmax(logits,dim = -1)
20transcription = processor.batch_decode(predicted_ids)
21
22print("Phonetic transcription : ", transcription)| Model | Test Set | PER |
|---|---|---|
| Cnam-LMSSC/wav2vec2-french-phonemizer | Common Voice v13 (French) | 5.52% |
| Cnam-LMSSC/wav2vec2-french-phonemizer | Multilingual Librispeech (French) | 4.36% |
1@misc {lmssc-wav2vec2-base-phonemizer-french_2023,
2 author = { Olivier, Malo AND Hauret, Julien AND Bavu, {É}ric },
3 title = { wav2vec2-french-phonemizer (Revision e715906) },
4 year = 2023,
5 url = { https://huggingface.co/Cnam-LMSSC/wav2vec2-french-phonemizer },
6 doi = { 10.57967/hf/1339 },
7 publisher = { Hugging Face }
8}