Views
No views yet
src/tokenizer — Standard BPE + entropy-weighted BPEsrc/embedding — FED, FED-Dk, RoPE, ARFSsrc/model — Transformer stack (MLA + MoE + RMSNorm)src/training — Objectives, optimizer/scheduler, Ray Tune, pipeline registry/rechecktests — Pytest smoke testsscripts — Standalone smoke-test runner1python3 -m venv .venv
2source .venv/bin/activate
3python -m pip install --upgrade pip
4python -m pip install -r requirements.txtscripts/prepare_wiki.py: Extracts Wikipedia articles into JSONL format (streaming).scripts/train_on_wiki.py: Trains the LatentRoute model on Wikipedia with all innovations enabled.src/model/hf_utils.py: Uploads your trained model to the Hugging Face Hub.1source .venv/bin/activate
2python scripts/train_on_wiki.py --total_steps 50001source .venv/bin/activate
2python scripts/run_smoke_test.pySmoke test passedoverall_ready: True1source .venv/bin/activate
2PYTHONPATH=. pytest -q1source .venv/bin/activate
2PYTHONPATH=. python - <<'PY'
3from src.training.ray_tune_train import run_quick_tune_local
4
5best = run_quick_tune_local(num_samples=2)
6print('Best config:', best.config)
7print('Best loss:', best.metrics.get('loss'))
8print('Best perplexity:', best.metrics.get('perplexity'))
9PY1source .venv/bin/activate
2ray stop --force
3ray start --head --dashboard-host=127.0.0.1 --dashboard-port=8265 --disable-usage-stats1python - <<'PY'
2import urllib.request
3for u in ["http://127.0.0.1:8265", "http://127.0.0.1:8265/api/version"]:
4 with urllib.request.urlopen(u, timeout=5) as r:
5 print(u, r.status)
6PY1source .venv/bin/activate
2PYTHONPATH=. python - <<'PY'
3from src.training.pipeline import build_full_innovation_model, recheck_pipeline_connections
4
5model = build_full_innovation_model(
6 vocab_size=512,
7 d_model=256,
8 n_layers=2,
9 n_heads=8,
10 max_seq_len=256,
11 n_experts=8,
12 d_c=64,
13 d_rope=16,
14)
15report = recheck_pipeline_connections(model)
16print(report)
17PYL_CElambda_1 * L_routelambda_2 * L_aux| Component | Standard | With innovations |
|---|---|---|
| Embedding memory (50K vocab) | ~800 MB | ~55 MB (up to -93%) |
| KV-cache (large-model scenario) | very high | strongly reduced via MLA/HLCR |
| MoE routing compute | $O(E)$ | hierarchical approx. $O(\sqrt{E})$ |
| Effective vocabulary | baseline | can reduce via entropy-weighted merges |
| Total inference cost | baseline | substantial reduction depending on scale |
src/model/__init__.py:
LLM, TransformerLM, MLAAttention, MoELayersrc/training/objectives.py:
compute_language_model_losssrc/training/optim.py:
create_adamw, CosineWithWarmupsrc/training/ray_tune_train.py:
run_quick_tune_local, build_tuner, train_llm_raysrc/training/pipeline.py: