Views
No views yet
FFN_vision, FFN_audio, FFN_text (hard-coded routing by modality type, no learnable gating)| Metric | 3-way (V+A+T) | 2-way (V+T) | 2-way (A+T) |
|---|---|---|---|
| Vision MSE | 0.0397 | 0.0388 | — |
| Audio MSE | 0.0238 | — | 0.0227 |
| Text CE | 2.1804 | 2.2026 | 2.0011 |
| Routing Strategy | Vision MSE | Text CE | Params |
|---|---|---|---|
| Separated FFN (hard-coded, ours) | 0.0388 | 2.2026 | 10.1M |
| Soft MoE (Top-1 Gating) | 0.0408 | 2.6232 | 10.1M |
| Shared FFN (no routing) | 0.0370 | 2.5434 | 9.0M |
1CONFIG = {
2 "d_model": 256,
3 "n_heads": 4,
4 "ffn_dim": 512,
5 "n_layers": 6,
6 "vocab_size": 10000,
7 "patch_size": 16,
8 "max_seq_len": 512,
9 "dropout": 0.1,
10 "audio_feat_dim": 768,
11 "audio_max_tokens": 200,
12}best.pt — Best checkpoint (epoch 44, total loss 2.2421)model.py — Model architecture (TriModalTransformerBlock)data.py — Dataset loaderstrain.py — Training looptraining_log.json — Full training logconfig.json — Hyperparameters