Views
No views yet
None for pixel_values. The model uses a zero tensor internally, falling back to audio-only behavior—no code changes required.1from inference_multimodal import predict_endpoint
2
3result = predict_endpoint(audio_array, video_path="clip.mp4")
4# result = {"prediction": 1, "probability": 0.92}
5
6# Audio-only fallback
7result = predict_endpoint(audio_array, video_path=None)