Views
No views yet
1import torch
2from transformers import AutoModel, AutoTokenizer
3
4model_name = "Seznam/retromae-small-cs" # Hugging Face link
5tokenizer = AutoTokenizer.from_pretrained(model_name)
6model = AutoModel.from_pretrained(model_name)
7
8input_texts = [
9 "Dnes je výborné počasí na procházku po parku.",
10 "Večer si oblíbím dobrý film a uvařím si čaj."
11]
12
13# Tokenize the input texts
14batch_dict = tokenizer(input_texts, max_length=512, padding=True, truncation=True, return_tensors='pt')
15
16outputs = model(**batch_dict)
17embeddings = outputs.last_hidden_state[:, 0] # Extract CLS token embeddings
18
19similarity = torch.nn.functional.cosine_similarity(embeddings[0], embeddings[1], dim=0)