Training data for ProtSent (Protein Sentence Transformers) — a contrastive fine-tuning
framework that adapts protein language models (ESM-2, ESM-C) into general-purpose sequence
embeddings, so that nearest-neighbor distance reflects functional, evolutionary, and structural
similarity between proteins.
Paper: ProtSent: Protein Sentence Transformers (Ofer, Perets, Linial, Rappoport), arXiv:2605.06830
Code:
https://github.com/oriel9p/ProtSent
Models:… See the full description on the dataset page:
https://huggingface.co/datasets/GrimSqueaker/protsent-data.