Views
No views yet
llama-3.2-1B-layer8-forward-model/fwd_model.pt (weights), config.json (training config and metrics)toy-gpt-30M-layer1-forward-model/fwd_model.pt (forward model weights), main_model.pt (main GPT weights), config.json (training config and metrics)1import torch
2from forward_model import TransformerForwardModel
3
4# Llama forward model
5fwd = TransformerForwardModel(
6 d_model=2048, d_head=128, n_head=1, n_layer=1,
7 mlp_mult=2.0, block_size=2048, use_swiglu=True,
8)
9fwd.load_state_dict(torch.load("llama-3.2-1B-layer8-forward-model/fwd_model.pt", map_location="cpu"))
10
11# Toy GPT forward model
12fwd_toy = TransformerForwardModel(
13 d_model=256, d_head=64, n_head=1, n_layer=1,
14 mlp_mult=2, block_size=128,
15)
16fwd_toy.load_state_dict(torch.load("toy-gpt-30M-layer1-forward-model/fwd_model.pt", map_location="cpu"))forward_model.py and gpt_model.py are included in the repo root for convenience.