Views
No views yet
sentence-transformers/all-MiniLM-L6-v2C2T5_crossv2paper_repo_pairs: paper/repository pair records from the Repository Library alignment pipeline.exports/paper_repo_span_align.jsonldedupe: truebalance_binary: truepairs_min_chars=64, pairs_max_chars=131072paper_repo_pairs[0.9, 0.1, 0.0]bf16contrastiveauto5e-05full_finetuneeval_roc_aucddprecall_at_10, ndcg_at_10eval_loss: 0.4323210120201111eval_pair_accuracy: 0.4838709677419355eval_positive_score_mean: 0.42978216651827095eval_negative_score_mean: 0.3917496839421801eval_score_margin_mean: 0.03803248257609082eval_roc_auc: 0.5416666666666666eval_best_pair_accuracy: 0.5967741935483871eval_best_threshold: 0.29271391034126281import torch
2from transformers import AutoModel, AutoTokenizer
3
4repo_id = "PeytonT/repo-paper-alignment"
5
6tokenizer = AutoTokenizer.from_pretrained(repo_id)
7model = AutoModel.from_pretrained(repo_id)
8model.eval()
9
10def mean_pool(last_hidden_state, attention_mask):
11 mask = attention_mask.unsqueeze(-1).type_as(last_hidden_state)
12 return (last_hidden_state * mask).sum(dim=1) / mask.sum(dim=1).clamp_min(1.0)
13
14def encode(text):
15 inputs = tokenizer(text, return_tensors="pt", truncation=True, max_length=256, padding=True)
16 with torch.no_grad():
17 outputs = model(**inputs)
18 return torch.nn.functional.normalize(mean_pool(outputs.last_hidden_state, inputs["attention_mask"]), dim=-1)
19
20paper = "PAPER: We introduce a contrastive method for aligning scientific methods to implementation spans."
21repo = "REPOSITORY: This module builds pairwise paper-code alignment examples and trains a contrastive encoder."
22score = torch.nn.functional.cosine_similarity(encode(paper), encode(repo)).item()
23print(score)eval_roc_auc around 0.542), so this checkpoint should be treated as a research component and not a final alignment benchmark.