Views
No views yet
bert-base-multilingual-cased1from transformers import AutoTokenizer, AutoModel
2
3model_name = "viswadarshan06/Tamil-MLM" # Replace with your model path
4tokenizer = AutoTokenizer.from_pretrained(model_name)
5model = AutoModel.from_pretrained(model_name)
6
7# Tokenizing a sample Tamil text
8text = "தமிழ் மொழியில் இயற்கை மொழி செயலாக்கம் முக்கியம்!"
9tokens = tokenizer(text, return_tensors="pt")
10
11# Getting model embeddings
12outputs = model(**tokens)
13print(outputs.last_hidden_state.shape) # Output shape: (batch_size, seq_length, hidden_size)