A 500-query benchmark for evaluating audio tool-use agents on deepfake-related forensic tasks.
Each query is a multi-turn ReAct-style dialog in which an assistant invokes audio analysis tools
(e.g. speaker_verification, nisqa, silero_vad, deepfake_audio, language_id, muq,
calculator) over a single audio file and produces a final verdict.