Views
No views yet
1state_dict_mapping = {
2 "tok_embeddings.weight": "model.embed_tokens.weight",
3 "norm.weight": "model.norm.weight",
4 "output.weight": "lm_head.weight"
5}
6
7def map_layer(i):
8 return {
9 f"layers.{i}.attention.wq.weight": f"model.layers.{i}.self_attn.q_proj.weight",
10 f"layers.{i}.attention.wk.weight": f"model.layers.{i}.self_attn.k_proj.weight",
11 f"layers.{i}.attention.wv.weight": f"model.layers.{i}.self_attn.v_proj.weight",
12 f"layers.{i}.attention.wo.weight": f"model.layers.{i}.self_attn.o_proj.weight",
13 f"layers.{i}.feed_forward.w1.weight": f"model.layers.{i}.mlp.gate_proj.weight",
14 f"layers.{i}.feed_forward.w2.weight": f"model.layers.{i}.mlp.down_proj.weight",
15 f"layers.{i}.feed_forward.w3.weight": f"model.layers.{i}.mlp.up_proj.weight",
16 f"layers.{i}.attention_norm.weight": f"model.layers.{i}.input_layernorm.weight",
17 f"layers.{i}.ffn_norm.weight": f"model.layers.{i}.post_attention_layernorm.weight",
18 }
19
20for i in range(32):
21 state_dict_mapping.update(map_layer(i))