Views
No views yet
CoSENT微调1from numpy.linalg import norm
2from transformers import AutoModel
3
4model_path = "OctopusMind/longbert-embedding-8k-zh"
5model = AutoModel.from_pretrained(model_path, trust_remote_code=True)
6
7sentences = ['我是问蚂蚁借呗为什么不能提前结清欠款', "为什么借呗不能选择提前还款"]
8embeddings = model.encode(sentences)
9cos_sim = lambda a,b: (a @ b.T) / (norm(a)*norm(b))
10print(cos_sim(embeddings[0], embeddings[1]))1[
2 {
3 "sentence1": "一个男人在吹一支大笛子。",
4 "sentence2": "一个人在吹长笛。",
5 "label": 3
6 },
7 {
8 "sentence1": "三个人在下棋。",
9 "sentence2": "两个人在下棋。",
10 "label": 2
11 },
12 {
13 "sentence1": "一个女人在写作。",
14 "sentence2": "一个女人在游泳。",
15 "label": 0
16 }
17]train/路径下cd train/1python cosent_finetune.py \
2 --data_dir ../data/train_data.json \
3 --output_dir ./outputs/my-model \
4 --max_seq_length 1024 \
5 --num_epochs 10 \
6 --batch_size 64 \
7 --learning_rate 2e-5