This is a merge of pre-trained language models created using
mergekit.
However, there is something very interesting going on with how layernorms progress in Gemma 3 12B versus models like Nemo 2407 12B.
This model was merged using the DeLERP merge method using
google/gemma-3-12b-pt as a base.
1models:
2 - model: google/gemma-3-12b-it
3 - model: google/gemma-3-12b-pt
4merge_method: delerp
5base_model: google/gemma-3-12b-pt
6parameters:
7 t:
8 - value: 0.999
9dtype: bfloat16
10