Views
No views yet
| File | Purpose |
|---|---|
model.py | MMT_JEPA model + EMA target encoder |
dataset.py | ObjA, ObjB, ObjC dataset classes |
tokenizer.py | Trains a joint BPE tokenizer on all text data |
train.py | Training loop (all objectives) |
train_b.py | Training loop (Objective B only) |
pip install torch librosa soundfile sentencepiece datasets1python tokenizer.py
2# outputs: tokenizer.model, tokenizer.vocabpython train.pycheckpoints/epoch{N}.pt after each epoch.| Objective | Dataset |
|---|---|
| A + C (English audio) | LibriSpeech train-clean-100 |
| A + C (Twi audio) | twi-speech-text-multispeaker-16k |
| B (translation) | twi-english-paragraph-dataset_news · english-twi-sentences-non-nouns · english-twi-nouns-v2 |
ModelConfig in model.py to change capacity:1d_model = 512 # embedding dimension
2trunk_layers = 6 # shared transformer depth
3vocab_size = 16_000
4n_mels = 80
5sample_rate = 16_000COLLAPSE when std < 0.01 or cos_sim > 0.99