Views
No views yet
EuroBERT/EuroBERT-210m, puis entraîné avec la technique InfoNCE sur des paires de très haute qualité générées par LLMEuroBERT/EuroBERT-210msentence-transformerspip install -U sentence-transformers1from sentence_transformers import SentenceTransformer
2
3model = SentenceTransformer("OrdalieTech/Solon-embeddings-mini-beta-1.1")
4sentences = ["Ceci est une phrase d'exemple", "Chaque phrase est convertie en vecteur"]
5embeddings = model.encode(sentences, convert_to_tensor=False, normalize_embeddings=True)
6print(embeddings[0].shape) # (768,)transformers (feature extraction)pip install -U transformers torch1from transformers import AutoTokenizer, AutoModel
2import torch
3
4tok = AutoTokenizer.from_pretrained("EuroBERT/EuroBERT-210m", trust_remote_code=True)
5enc = AutoModel.from_pretrained("EuroBERT/EuroBERT-210m", trust_remote_code=True)
6
7inputs = tok(["Ceci est une phrase d'exemple"], padding=True, truncation=True, return_tensors="pt")
8with torch.no_grad():
9 out = enc(**inputs).last_hidden_state # (batch, seq, 768)
10
11mask = inputs["attention_mask"].unsqueeze(-1) # (batch, seq, 1)
12mean_emb = (out * mask).sum(dim=1) / mask.sum(dim=1).clamp(min=1)EuroBERT/EuroBERT-210m • licence Apache-2.0