Modèle d'embeddings fine-tuné sur le droit français, à partir de
paraphrase-multilingual-mpnet-base-v2
et du dataset
louisbrulenaudet/legalkit
(~53k articles de codes juridiques français).
1from sentence_transformers import SentenceTransformer
2
3model = SentenceTransformer("IvanDVonga/LegalEmbed")
4
5query = "Question juridique : Quelles sont les conditions de validité d'un contrat ?"
6doc = "Texte de loi : Pour qu'un contrat soit valable, il faut le consentement des parties."
7
8embeddings = model.encode([query, doc], normalize_embeddings=True)
9similarity = embeddings[0] @ embeddings[1]
10print(f"Similarité : {similarity:.4f}")