Views
No views yet
CondadosAI/ for use with the acaua computer vision library.pytorch_model.bin (pickle format) that upstream ships alongside model.safetensors has been deliberately removed for security hygiene — pickle loads can execute arbitrary code, and transformers auto-prefers safetensors when both are present, so removing it has zero functional impact on downstream users.AutoModelForVideoClassification.| Upstream repo | microsoft/xclip-base-patch32 |
| Upstream commit SHA | a2e27a78a2b5d802e894b8a1ef14f3a8ce490963 |
| Upstream commit date | 2024-02-04 |
| Declared license | MIT |
| Paper | Ni et al., "Expanding Language-Image Pretrained Models for General Video Recognition", ECCV 2022, arXiv:2208.02816 |
| Official code | microsoft/VideoX (MIT) |
| Mirrored on | 2026-04-23 |
| Mirrored by | CondadosAI/acaua |
1import acaua
2
3model = acaua.Model.from_pretrained(
4 "CondadosAI/xclip_base_patch32",
5 allow_non_apache=True, # weights are MIT, not Apache-2.0
6)
7result = model.predict(
8 "dance.mp4",
9 labels=["dancing", "cooking", "running", "sleeping", "walking"],
10 top_k=3,
11)
12for label, score in zip(result.labels, result.scores.tolist()):
13 print(f"{label}: {score:.3f}")1from transformers import XCLIPModel, XCLIPProcessor
2
3processor = XCLIPProcessor.from_pretrained("CondadosAI/xclip_base_patch32")
4model = XCLIPModel.from_pretrained("CondadosAI/xclip_base_patch32")vision_config.num_frames=8).XCLIPProcessor).NOTICE for required attribution.1@inproceedings{ni2022expanding,
2 title={Expanding language-image pretrained models for general video recognition},
3 author={Ni, Bolin and Peng, Houwen and Chen, Minghao and Zhang, Songyang and Meng, Gaofeng and Fu, Jianlong and Xiang, Shiming and Ling, Haibin},
4 booktitle={European Conference on Computer Vision (ECCV)},
5 pages={1--18},
6 year={2022},
7 publisher={Springer}
8}