Bielik-11B-v3-Instruct-Abliterated-Heretic-RP1
(baza Bielik-11B-v3-Instruct od SpeakLeash)
Metoda: Heretic --refusal_prefixes
Refusals 4/100;
Trial 19/200;
batch size 64;
KL: 1.0750;
Model Heretic z 4/100 uzyskano w 19 próbie za pomocą metody Heretic Meta-Prompting z uzyciem --refusal_prefixes.
--refusal_prefixes uzyskano bezpośrednio od modelu bazowego w wyniku obniżenia modelowych parametrów bazowych
i wymuszenia odpowiedzi w formie TOP10 odmów uzytego w --refusal_prefixes
Bazowanie na języku angielskim i zestawach promptów (harmless_alpaca i harmful_behaviors (400pytań) z repozytorium Maxime Labonne)
dawało słabe rezultaty, prawdopodobnie ze względu na tłumaczenie na jezyk polski. Stąd zaistniała potrzeba ręcznego odpytania
modelu bazowego, jakie formuły odmów stosuje.
Trial 1 - KL: 0.9850 Refusals: 49/100
Trial 8 - KL: 1.0667 Refusals: 32/100
Trial 19 - KL: 1.0750 Refusals: 4/100
Trial 45 - KL: 1.0734 Refusals: 16/100
Baza testowa:
CPU: AMD Ryzen 7 3700X
GPU (Testing): KFA2 GeForce RTX 3090
GPU (support): Dell Nvidia Tesla v100 16GB
RAM: 64GB DDR4
Storage: SSD: 2TB Lexar NM1090Pro (NVMe PCIe 5.0), HDD: 8TB HGST Ultrastar He8