This Mira is certainly an A👁️.
Trying out swcm merge method for tuning - sft run for 4 hrs, 3x, once in general, once on attention only, once on MLP.
Unfortunately SFT seems to be consistently hurting her creativity, even with good data and continued pretraining; not sure what's going on.
Tried to repair that with DPO but only slight gains there.
Karcher merge back with some of her most creatively talented versions definitely helped bring it up again, at least ...
This is a merge of pre-trained language models created using
mergekit.
This model was merged using the
Karcher Mean merge method.
1merge_method: karcher
2
3models:
4 - model: ../Mira-1.24.1-27B-dpo-soup
5 - model: ../Mira-v1.24-27B-swcm
6 - model: Lambent/Mira-v1.20-27B-dpo
7 - model: Lambent/Mira-v1.23.1-27B-dpo
8
9dtype: bfloat16
10tokenizer_source: ../Mira-v1.24-27B-swcm
11