Views
No views yet
apt install ffmpegpip install 'git+https://github.com/line/lighthouse.git'pip install torch==2.1.0 torchvision==0.16.0 torchaudio==2.1.0 torchtext==0.16.0 transformers==4.51.3 --index-url https://download.pytorch.org/whl/cu1181import io
2import requests
3
4import torch
5from transformers import AutoModel, AutoConfig
6
7
8repo_id = "lighthouse-emnlp2024/AM-DETR"
9
10config = AutoConfig.from_pretrained(repo_id, trust_remote_code=True)
11config.device="cpu"
12model = AutoModel.from_pretrained(repo_id, config=config, trust_remote_code=True)
13
14audio_bytes = io.BytesIO(requests.get('https://github.com/line/lighthouse/raw/refs/heads/main/api_example/1a-ODBWMUAE.wav').content)
15query = "Heavy rain falls"
16
17feats = model.encode_audio(audio_path=audio_bytes)
18prediction = model.predict(query, feats)
19for start, end, score in prediction["pred_relevant_windows"]:
20 print(f"Moment, Score: {start:05.2f} - {end:05.2f}, {score:.2f}")
211@inproceedings{munakata2025language,
2 title={Language-based Audio Moment Retrieval},
3 author={Munakata, Hokuto and Nishimura, Taichi and Nakada, Shota and Komatsu, Tatsuya},
4 booktitle={ICASSP 2025-2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)},
5 pages={1--5},
6 year={2025},
7 organization={IEEE}
8}