Views
No views yet
| Property | Value |
|---|---|
| Base model | openai/whisper-large-v3-turbo (809M params) |
| Fine-tuned on | MohamedRashad/arabic-english-code-switching |
| Language | Egyptian Arabic + English (code-switching) |
| Training | Encoder frozen, decoder fine-tuned |
| Precision | bfloat16 |
| Model | Output |
|---|---|
| Base whisper-large-v3-turbo | تعالوا نبني مع بعض برنامج توصيل أكل من غير ما نكتب ولا سطر كود عن طريق منصة ريبليت منزلين عندهم إيجنت فور |
| This model | تعالوا نبني مع بعض برنامج توصيل أكل من غير ما نكتب ولا سطر code عن طريق منصة Replit منزلين عندهم Agent 4 |
pipeline (simplest)1from transformers import pipeline, AutoProcessor
2import torch
3
4model_id = "mohammedaly22/whisper-large-v3-turbo-egyptian-code-switching"
5
6# Manually load the processor
7processor = AutoProcessor.from_pretrained(model_id)
8
9pipe = pipeline(
10 "automatic-speech-recognition",
11 model=model_id,
12 processor=processor,
13 torch_dtype=torch.float16, # Better for CUDA
14 device="cuda",
15 chunk_length_s=30,
16)
17
18result = pipe(
19 "/path/to/audio.wav",
20 generate_kwargs={"language": "arabic", "task": "transcribe"},
21)
22
23print(result["text"])Processor + Model1import torch
2import librosa
3from transformers import WhisperProcessor, WhisperForConditionalGeneration
4
5model_id = "mohammedaly22/whisper-large-v3-turbo-egyptian-code-switching"
6
7processor = WhisperProcessor.from_pretrained(model_id)
8model = WhisperForConditionalGeneration.from_pretrained(model_id, torch_dtype=torch.bfloat16).to("cuda")
9
10# Load audio
11audio, sr = librosa.load("path/to/audio.wav", sr=16000)
12
13# Process
14input_features = processor.feature_extractor(
15 audio, sampling_rate=16000, return_tensors="pt"
16).input_features.to(device="cuda", dtype=torch.bfloat16)
17
18# Generate
19with torch.no_grad():
20 generated_ids = model.generate(
21 input_features,
22 max_new_tokens=444,
23 language="ar",
24 task="transcribe",
25 )
26
27# Decode
28text = processor.tokenizer.batch_decode(generated_ids, skip_special_tokens=True)[0]
29print(text)1import torch
2import librosa
3from transformers import WhisperProcessor, WhisperForConditionalGeneration
4
5model_id = "mohammedaly22/whisper-large-v3-turbo-egyptian-code-switching"
6processor = WhisperProcessor.from_pretrained(model_id)
7model = WhisperForConditionalGeneration.from_pretrained(model_id, torch_dtype=torch.bfloat16).to("cuda")
8
9audio_files = ["audio1.wav", "audio2.wav", "audio3.wav"]
10audios = [librosa.load(f, sr=16000)[0] for f in audio_files]
11
12inputs = processor.feature_extractor(
13 audios, sampling_rate=16000, return_tensors="pt", padding=True
14)
15input_features = inputs.input_features.to(device="cuda", dtype=torch.bfloat16)
16
17with torch.no_grad():
18 generated_ids = model.generate(
19 input_features,
20 max_new_tokens=444,
21 language="ar",
22 task="transcribe",
23 )
24
25texts = processor.tokenizer.batch_decode(generated_ids, skip_special_tokens=True)
26for t in texts:
27 print(t)@misc{whisper-large-v3-turbo-egyptian-cs,
title={Whisper Large V3 Turbo — Egyptian Arabic Code-Switching},
author={Mohammed Aly},
year={2025},
url={https://huggingface.co/mohammedaly22/whisper-large-v3-turbo-egyptian-code-switching}
}