Views
No views yet
latent sequence : [<boe> z_env <bos> z_spk <bon> z_target]
text sequence : [<boe_t> env_text_emb <bos_t> spk_text_emb <bon_t> target_text_emb]encode_multistream_text(env, spk, target, drop_env_text=…, drop_spk_text=…, drop_target_text=…) is the new entry-point. AudioDiTModel.forward(...) also
accepts a pre-assembled prompt_latent (replaces prompt_audio) so the inference
path can feed the boundary-tokenized three-stream prompt directly.| Field | Value |
|---|---|
| Steps | 6000 |
| Effective batch | 16 × grad_accum 2 × 2 GPU = 64 rows / step |
| Learning rate | cosine 5e-5 (warmup 250) |
| AdamW | β₁=0.9, β₂=0.999, wd=0.01 |
| EMA | disabled |
| LoRA | r=32, alpha=32, target = attn + ffn |
| Full-train | boundary tokens + AdaLN + text_conv + latent_embed + input_embed + output_proj + time_embed |
| Audio filter | target duration ∈ [3, 45] s |
| RMS normalize | three-stream independent to -23 dBFS (target_rms=0.0708) |
| Augmentation | noise + RIR on spk_audio (DNS5 64GB) |
| Data | ChristianYang/Env-TTS-Clean |
trust_remote_code=True:1from transformers import AutoModel, AutoTokenizer
2
3model = AutoModel.from_pretrained(
4 "meituan-longcat/LongCat-AudioDiT-Env-TTS-1B-6000Step",
5 trust_remote_code=True,
6).cuda().eval()
7
8tokenizer = AutoTokenizer.from_pretrained(model.config.text_encoder_model)inference_env_tts.py.