Views
No views yet
| Property | Value |
|---|---|
| Base Model | ResembleAI/Dramabox (LTX-2.3-22B Audio-Only) |
| Fine-tuning Method | LoRA (rank=128, alpha=128) |
| Trainable Parameters | ~15M / 3.2B total (~0.5%) |
| Training Data | DramaBox voice acting (50%) + Podcasts (50%) |
| Auxiliary Losses | 6 (naturalness, quality, centroid, speaker sim, comb filter, artifact v2) |
| Best Checkpoint | Step 80 (best flow matching loss = 0.418) |
| Training Hardware | 8× A100 80GB |
| Precision | bfloat16 |
LoRA params → velocity prediction → x₀ recovery → VAE decoder → waveform → CLAP embedding → loss.
├── lora_weights.safetensors # Main LoRA checkpoint (865 MB)
├── training_config.yaml # Training configuration
├── training_args.yaml # Full training arguments
├── discriminators/
│ ├── quality_classifier.pt # Quality/MOS prediction MLP
│ ├── real_fake_classifier.pt # Real vs AI detection MLP
│ ├── best_artifact_detector_v2.pt # CNN artifact detector (latent space)
│ ├── best_comb_detector.pt # CNN comb filter detector (latent space)
│ └── best_clap_medium.pt # CLAP-based artifact MLP
├── scripts/
│ ├── dramabox_finetune_train_multi_aux.py # Main training script (6-aux)
│ ├── dramabox_finetune_train.py # Base training script
│ ├── dramabox_finetune_prepare.py # Data preparation
│ ├── train_artifact_detector_v2.py # Artifact detector training
│ ├── train_artifact_detector_clap.py # CLAP artifact detector training
│ ├── train_comb_filter_detector.py # Comb filter detector training
│ └── train_binary_classifiers.py # Quality/real-fake classifier training
└── configs/
└── *.yaml # All training configurationsdiscriminators/quality_classifier.pt)discriminators/real_fake_classifier.pt)discriminators/best_artifact_detector_v2.pt)discriminators/best_comb_detector.pt)discriminators/best_clap_medium.pt)1from safetensors.torch import load_file
2
3# Load base DramaBox model
4model = load_dramabox_model("ResembleAI/Dramabox")
5
6# Apply LoRA weights
7lora_weights = load_file("lora_weights.safetensors")
8apply_lora(model, lora_weights, rank=128, alpha=128)1@misc{laionbox2026,
2 title={LaionBox: Fine-tuning DramaBox TTS with Multi-Auxiliary Differentiable Losses},
3 author={LAION},
4 year={2026},
5 url={https://huggingface.co/laion/laionbox-v0.2-wip}
6}