Views
No views yet
| Folder | Encoder | Step | Tokens seen | Rows seen |
|---|---|---|---|---|
encodec/checkpoint-30000 | EnCodec (24 kHz) | 30,000 | 3.93B | 8.4M |
encodec/checkpoint-40000 | EnCodec (24 kHz) | 40,000 | 5.24B | 11.2M |
encodec/checkpoint-80000 | EnCodec (24 kHz) | 80,000 | 10.49B | 22.3M |
encodec/checkpoint-90000 ★ | EnCodec (24 kHz) | 90,000 | 11.80B | 25.1M |
dacvae/checkpoint-80000 ★ | DAC-VAE (48 kHz) | 80,000 | 4.59B | 9.76M |
dacvae-asr-only/checkpoint-100000 ★ | DAC-VAE (48 kHz), ASR-only mix | 100,000 | 5.73B | 12.2M |
whisper-small/checkpoint-94000 ★ | Whisper-small (16 kHz) | 94,000 | 10.78B | 22.9M |
| Folder | Encoder | Step | Notes |
|---|---|---|---|
whisper-tiny/stage2/checkpoint-30000 ★ | Whisper-tiny (16 kHz) | 30,000 | LoRA r=32 α=64 on Qwen3.5-4B linears; projector retrained. Base = Stage-1 best (ckpt-100000). Best by 10-metric rank-sum. |
global_batch x cutoff_len. EnCodec = 32 x 4096 = 131,072. Whisper-small = 32 x 3584 = 114,688. DAC-VAE = 16 x 3584 = 57,344.tokens / 470 (row-size weighted mean of training row token length).dacvae-asr-only: ASR-only Stage-1 ablationdacvae/checkpoint-80000, but trained with the ASR-only manifest (single-source audio_asr mix at probability 1.0) instead of the default Stage-1 multi-task mix (ASR 65% / env_sound 25% / emotion 10%). Useful for isolating the effect of multi-task interference on DAC-VAE's projector. Best ASR WER at step 100,000 (no rank-sum tradeoff since non-ASR metrics are not meaningful for an ASR-only run).whisper-tiny/stage2/checkpoint-30000: Stage-2 LoRA ablationencodec/checkpoint-{30000,40000,80000} vs checkpoint-90000encodec/checkpoint-* folders contain the full training state (model + DeepSpeed optimizer + RNG, ~26 GiB each) for resume / forensic use. encodec/checkpoint-90000 and whisper-small/checkpoint-94000 are inference-only (model + tokenizer + code, ~10 GB each) — global_step{N}/, rng_state_*.pth, training_args.bin, latest, zero_to_fp32.py, trainer_state.json are excluded. dacvae-asr-only/checkpoint-100000 includes the full training state (resume-capable). whisper-tiny/stage2/checkpoint-30000 is a merged inference-ready model (LoRA + projector merged into base, no adapter file).1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3repo = "SJ2048/qwen35ae-v6-trajectory"
4subfolder = "encodec/checkpoint-90000" # or any other folder above
5
6model = AutoModelForCausalLM.from_pretrained(
7 repo, subfolder=subfolder, trust_remote_code=True
8)
9tokenizer = AutoTokenizer.from_pretrained(
10 repo, subfolder=subfolder, trust_remote_code=True
11)stopping_strategy=all_exhausted.