Views
No views yet
fp16 (أرقام عشرية، مخصصة لتسريع الأداء على كروت الشاشة اللي بتدعم تقنية CUDA) / int8 (أرقام صحيحة، متظبطة عشان تشتغل بكفاءة على المعالج الأساسي CPU).1from faster_whisper import WhisperModel
2
3# تحميل الموديل وتجهيزه للعمل على كارت الشاشة
4model = WhisperModel('Mano200600/faster-whisper-large-v2-ar-codeswitching', device='cuda', compute_type='float16')
5
6# تنفيذ عملية تحويل الصوت لنص
7segments, _ = model.transcribe('audio.mp3', beam_size=5)
8
9for segment in segments:
10 print(f"[{segment.start:.2f}s -> {segment.end:.2f}s] {segment.text}")WhisperModel: النموذج الذكي (AI Model) المسؤول عن فهم وتحليل الصوت.device='cuda': توجيه العمليات لكارت الشاشة (Graphics Processing Unit - GPU) لضمان أداء أسرع بكتير من المعالج العادي.compute_type='float16': تقنية لتقليل استهلاك الذاكرة (Memory Efficiency) باستخدام أرقام عشرية بسيطة، وده بيسرع التنفيذ من غير ما يأثر على الجودة.transcribe: الوظيفة الأساسية (Function) اللي بتقوم بعملية التفريغ الصوتي.beam_size: عدد المسارات البديلة (Search Paths) اللي الموديل بيفحصها عشان يختار أدق كلمة ممكنة، ورقم 5 بيحقق توازن ممتاز بين الدقة والسرعة.1@article{radford2023robust,
2 title={Robust Speech Recognition via Large-Scale Weak Supervision},
3 author={Radford, Alec and Kim, Jong Wook and Xu, Tao and Brockman, Greg and McLeavey, Christine and Sutskever, Ilya},
4 journal={arXiv preprint arXiv:2212.04356},
5 year={2023}
6}