Views
No views yet

1from utils.video import read_frames_decord
2from models.modeling_encoders import AutoEncoder
3from torch.nn.functional import cosine_similarity
4
5encoder = AutoEncoder.from_pretrained('path/to/checkpoints/Tarsier-7B-RA')
6frames = read_frames_decord(video_path='assets/demo.mp4', num_frames=32)
7text = "This video features a man slicing tomatoes in the kitchen."
8vision_emb = encoder.encode_vision(frames.unsqueeze(0))
9text_emb = encoder.encode_text(text)
10print(f'Vision embedding shape: {vision_emb.shape}')
11print(f'Text embedding shape: {text_emb.shape}')
12print(f'Cosine similarity: {cosine_similarity(vision_emb, text_emb)}')