Pondok Melawati Lughah Konteks
Model ini ialah sebahagian daripada keluarga Pondok Melawati untuk pemprosesan bahasa Arab dan pembelajaran bahasa. Kad model ini dijana secara automatik oleh Model Melawati 2026 supaya metadata, widget inferens, keselamatan, dan penerangan repo sentiasa kemas.
Ringkasan
- Nama repo:
melawati/pondok-melawati-lughah-konteks
- Bidang: Makna perkataan mengikut konteks
- Tujuan: Menjana embedding atau persamaan semantik untuk memahami hubungan makna dalam ayat Arab.
- Pipeline:
sentence-similarity
Kegunaan
- Tugasan utama:
sentence-similarity
- Bahasa sasaran: Arab, dengan dokumentasi sokongan Bahasa Melayu
- Format disyorkan:
safetensors
- Status metrik: TBD selepas penilaian rasmi dijalankan
- Widget inferens: disediakan dalam metadata model card
Contoh Inferens
1from transformers import pipeline
2
3paip = pipeline("sentence-similarity", model="melawati/pondok-melawati-lughah-konteks")
4print(paip("العلم نور | المعرفة تهدي الإنسان"))
Data dan Latihan
Sila dokumentasikan sumber data, lesen, langkah pembersihan, pembahagian train/validation/test, serta sebarang penapisan PII. Untuk data Arab, normalisasi huruf, pengendalian tashkeel, dan semakan kebocoran data sangat disarankan.
Isu Yang Dikesan dan Tindakan
-
Widget inferens belum ditakrifkan
-
config.json tiada torch_dtype
-
README dikemas dengan nama repo yang tepat.
-
Metadata pipeline_tag dan widget ditetapkan mengikut tugasan model.
-
Jika config.json tiada torch_dtype, semak dtype sebenar weights sebelum mengubah konfigurasi Hub.
Had Model
Skor persamaan bukan fatwa bahasa; ia petunjuk statistik yang perlu ditafsir.
Keselamatan
Gunakan safetensors apabila memuat atau menyimpan berat model. Jangan muat naik token, data peribadi, atau data berlesen tanpa kebenaran.
Penyelenggaraan
Kad ini boleh dikemas kini melalui model_melawati.py dengan fungsi baik pulih, penilaian, dashboard, dan deployment Spaces.