Views
No views yet
1from transformers import AutoImageProcessor, TimesformerForVideoClassification
2import numpy as np
3import torch
4
5video = list(np.random.randn(8, 3, 224, 224))
6
7processor = AutoImageProcessor.from_pretrained("fcakyon/timesformer-base-finetuned-ssv2")
8model = TimesformerForVideoClassification.from_pretrained("fcakyon/timesformer-base-finetuned-ssv2")
9
10inputs = processor(images=video, return_tensors="pt")
11
12with torch.no_grad():
13 outputs = model(**inputs)
14 logits = outputs.logits
15
16predicted_class_idx = logits.argmax(-1).item()
17print("Predicted class:", model.config.id2label[predicted_class_idx])1@inproceedings{bertasius2021space,
2 title={Is Space-Time Attention All You Need for Video Understanding?},
3 author={Bertasius, Gedas and Wang, Heng and Torresani, Lorenzo},
4 booktitle={International Conference on Machine Learning},
5 pages={813--824},
6 year={2021},
7 organization={PMLR}
8}