Views
No views yet
sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2 to improve semantic similarity between financial terms across languages.datasetsdev_ratio=0.1)paraphrase-multilingual-MiniLM-L12-v2MultipleNegativesRankingLossHF_HOME)HF_HUB_OFFLINE=1TRANSFORMERS_OFFLINE=11from sentence_transformers import SentenceTransformer, util
2
3model = SentenceTransformer("yourname/minilm-finance-term-matcher")
4
5emb1 = model.encode("可转换债券")
6emb2 = model.encode("convertible bond")
7
8score = util.cos_sim(emb1, emb2)
9print(score)
10🧾 Example
11
12Input:
13
14"可转换债券"
15"convertible bond"
16
17Output:
18
19cosine similarity ≈ high (close match)
20🔗 Integration with Term Extraction
21
22This model is designed to work together with:
23
24BERT-based term extractors (EN & ZH)
25
26Pipeline:
27
28Extract terms from text
29Encode terms
30Perform cross-lingual matching
31⚠️ Limitations
32Domain-specific (finance)
33Performance depends on term coverage
34Not optimized for long sentences
35Sensitive to domain shift
36📜 License
37
38This model is trained on data licensed under CC BY-NC 4.0:
39
40✅ Non-commercial use allowed
41❌ Commercial use restricted
42✅ Attribution required
43
44The base model is Apache 2.0, but fine-tuned weights inherit dataset restrictions.
45
46🙏 Acknowledgements
47Base model: sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2
48Dataset: WMT 2025 terminology resources
49Framework: Sentence-Transformers
50Training API: SentenceTransformerTrainer