Views
No views yet
🔧 Code & reproduction complète : github.com/AlexandreFenyo/MonEspaceSante-H100-reproduction
fenyo/H100-Qwen3-14B-MonEspaceSante-CPT-SFT,
pensée pour tourner localement sur une RTX 5090 (32 Go) via Ollama / llama.cpp.Question : <votre question>
Réponse : <réponse>Modelfile fourni (et le chat-template embarqué dans le GGUF) reproduit exactement ce format.
N'utilisez pas un template de chat Qwen standard, sinon la qualité s'effondre.1# 1) Récupérer les deux fichiers de ce dépôt
2huggingface-cli download fenyo/H100-Qwen3-14B-MonEspaceSante-CPT-SFT-RTX5090-GGUF \
3 mes-faq-14b-Q8_0.gguf Modelfile --local-dir mes-faq-gguf
4cd mes-faq-gguf
5
6# 2) Créer le modèle Ollama (le Modelfile encode le format + température 0 pour la reproductibilité)
7ollama create mes-faq -f Modelfile
8
9# 3) Interroger (closed-book)
10ollama run mes-faq "Comment activer mon profil Mon espace santé ?"
11ollama run mes-faq "Qui peut consulter mes documents de santé ?"Modelfile fixe temperature 0, top_k 1, seed 0 → réponses déterministes/reproductibles, et
des stop pour couper proprement après la réponse.| Ce modèle (14B CPT+SFT) | gpt-oss-20b-FAQ-MES (20B) | SFT direct 14B (sans CPT) | |
|---|---|---|---|
| Exactitude (strict) | 63,8 % | 42,5 % | 37,2 % |
| Exactitude (indulgent) | 80,3 % | 67,8 % | 61,1 % |
| Hallucination hors-domaine | 12 % | 60 % | 56 % |
qwen3, contexte 32k.llama.cpp/convert_hf_to_gguf.py puis llama-quantize … Q8_0.Q6_K (~12 Go) ou Q5_K_M
(~10 Go) depuis le modèle source — Q8_0 est toutefois recommandé pour préserver le rappel factuel.Qwen/Qwen3-14B-Base →
base enrichie …-MonEspaceSante-CPT → ce CPT+SFT.