Views
No views yet
1 config_class = LlamaConfig
2
3 def __init__(self, config: LlamaConfig):
4 super().__init__(config)
5 self.embed_tokens = nn.Embedding(config.vocab_size, config.hidden_size)
6 self.layers = nn.ModuleList([AttentionLayer(config) for _ in range(config.num_hidden_layers)])
7 self.lm_head = nn.Linear(config.hidden_size, config.vocab_size, bias=False)
8
9
10model = AttentionOnlyTransformer.from_pretrained('Butanium/simple-stories-3L8H128D-attention-only-toy-transformer')