Views
No views yet
EMBO/soda-vec-data-full_pmc_title_abstract_pairedanswerdotai/ModernBERT-basepython scripts/soda-vec-train.py --config dot_only --coeff_dot 1 --push_to_hub --hub_org EMBO --save_limit 51from sentence_transformers import SentenceTransformer
2
3# Load the model
4model = SentenceTransformer("EMBO/dot_only")
5
6# Encode sentences
7sentences = [
8 "CRISPR-Cas9 gene editing in human cells",
9 "Genome editing using CRISPR technology"
10]
11
12embeddings = model.encode(sentences)
13print(f"Embedding shape: {embeddings.shape}")
14
15# Compute similarity
16from sentence_transformers.util import cos_sim
17similarity = cos_sim(embeddings[0], embeddings[1])
18print(f"Similarity: {similarity.item():.4f}")1from transformers import AutoTokenizer, AutoModel
2import torch
3import torch.nn.functional as F
4
5# Load model and tokenizer
6tokenizer = AutoTokenizer.from_pretrained("EMBO/dot_only")
7model = AutoModel.from_pretrained("EMBO/dot_only")
8
9# Encode sentences
10sentences = [
11 "CRISPR-Cas9 gene editing in human cells",
12 "Genome editing using CRISPR technology"
13]
14
15inputs = tokenizer(sentences, padding=True, truncation=True, return_tensors="pt")
16with torch.no_grad():
17 outputs = model(**inputs)
18
19# Mean pooling
20embeddings = outputs.last_hidden_state.mean(dim=1)
21
22# Normalize (for VICReg models)
23embeddings = F.normalize(embeddings, p=2, dim=1)
24
25# Compute similarity
26similarity = F.cosine_similarity(embeddings[0:1], embeddings[1:2])
27print(f"Similarity: {similarity.item():.4f}")1@software{soda_vec,
2 title = {SODA-VEC: Scientific Open Domain Adaptation for Vector Embeddings},
3 author = {EMBO},
4 year = {2024},
5 url = {https://github.com/source-data/soda-vec}
6}