LoRA adapter for detecting AI-generated (deepfake) speech, fine-tuned on top of
Speech-Arena-2025/DF_Arena_1B_V_1 (1.15B parameters).
Trained for 20 epochs (8.7 hrs) with phone-call audio augmentation on 6K samples.
Early-stopped at epoch 14/20 (best at epoch 2) on 2K samples.
1from peft import PeftModel
2from transformers import AutoModelForAudioClassification, AutoFeatureExtractor
3
4base_model = AutoModelForAudioClassification.from_pretrained("Speech-Arena-2025/DF_Arena_1B_V_1")
5model = PeftModel.from_pretrained(base_model, "gereon/voxguard-lora")
6feature_extractor = AutoFeatureExtractor.from_pretrained("Speech-Arena-2025/DF_Arena_1B_V_1")
7
8# For the non-augmented variant:
9# model = PeftModel.from_pretrained(base_model, "gereon/voxguard-lora", subfolder="non-augmented")