This model has been fine-tuned exclusively in Hungarian; it has not been modified or further trained in English or any other language!
A HOTHUN modellekről
Ez egy hobbiból készült, nagyon forró nsfw projekt, melynek célja, hogy azokat a modelleket, melyek eddig is tudtak valamilyen szinten magyarul, nsfw-képessé tegyem chatelésre, a modell stílusának megőrzésével vagy minimális változtatásával. Tehát a modellek elsősorban privát chatre készültek, 4096-os ctx ablakméretre.
A HOTHUN története
Fontosnak tartottam, hogy a modellek mobilon is futtathatók legyenek, viszont ez az elhatározásom komoly korlátokat állított fel:
a forrásmodell ne legyen 8B-nél nagyobb (maximum 9B)
alapból tudjon magyarul valamilyen szinten
az eredeti modellnek is legyenek nsfw képességei
Q4_0 kvantáláson (a mobilok hardveres támogatása miatt) ne essen szét túlságosan a magyar nyelv.
lehetőleg megmaradjon az eredeti modell gondolkodása, stílusa
azaz azt nyújtsa a modell, amit eredetileg angolul, csak magyar nyelven.
Több kihívással kellett szembenéznem:
az eredeti magyar datasetek szemetesek. Tehát amikkel az eredeti alapmodellt (például a Llama3 vagy Qwen) betanították, nem voltak kipucolva, nyelvtani és elütési hibákat tartalmaztak. Ezek a hibák a kis méretű modelleknél még inkább megjelennek, azaz felerősödik a "zaj".
új szavakat kellett magyarul megtanulnia a modellnek, mert az eredeti magyar datasetek nem rendelkeznek nsfw szókinccsel, azaz nem fedik le teljesen a magyar nyelvet. Így az eredeti modellek a válaszadáskor nem ismerték magyarul azt a szót, amit angolul igen.
az új szavakat is helyesen ragozza, de a régi, hibás szavak ragozási bakijait is csiszolni kellett.
a magyar nyelv és ragozás kihívásai, szépségei, azaz a modell magyarul is képes legyen úgy fogalmazni, ahogy angolul.
a továbbedzett/mixelt modellek már finomhangolások, azaz torzult bennük a magyar nyelv az eredeti alapmodellhez képest, viszont a stílusuk egyedibb, mint az eredetié.
Ezután olyan magyar adatbázisokat kellett keresnem, melyek nyilvánosan használhatók (ld. lentebb), illetve copyright-mentesek. Ezek között szintén nem volt nsfw szókincsű adatbázis, ezért a Gemini segítségével jó pár datasetet generáltattam, melyek egy része a nyelvtani kiigazításra összpontosítottak, más része az nsfw, vulgáris, obszcén szavakat helyezi előtérbe. Tehát a HOTHUN modellek erősen vulgáris nyelvezetűek, emiatt elsősorban személyes felhasználásra javaslom őket!
Melyiket válasszam?
A Stheno közvetlen, nyersebb stílusú, szerepjátékokra is jó, Llama3 formátumú
A Hermes inkább mesélő, narratív, ChatML formátumú
v1.4 modellek változásai az 1.3 verzióhoz képest
kis polírozás történt a birtokos ragoknál, elsősorban az -m/-d betű használatát rögzítettem (például kabátom-kabátod, szemem-szemed stb.), ami lényeges a magyar nyelvben.
Generálási paraméterek
Minden LLM programban és kvantálással más-más paramétereket kell beállítani a jó válaszok érdekében! A magyar nyelv miatt más paramétereket kell beállítani, mint az eredetileg ajánlottak!
A modellek érdekessége, hogy kétféle modellbeállításon másképp működnek.
Mirostat+Temp használatával sokkal természetesebbek, jobban átlátják a helyzetet, és logikusabb válaszokat adnak, de egy idő után hurokba kerülnek.
Hagyományos paraméterekkel (Temp, Top-P, Top-K, Min-P, Repetition Penalty) sokkal kötetlenebb a beszélgetés, de nehezebb a történetkövetés, azaz a modell inkább önfejű.
A ChatterUI-ban ezeket találtam a legjobbnak:
-- Mirostat módban (az alapbeállítások jók, de néha érdemes játszani velük):
-- Hagyományos módban - mindkét modellhez (engedd el, jobb lesz, hidd el):
Temp: 0.4-0.5
Top-P: 1
Top-K: 0
Min-P: 0
Repetition Penalty Range: 1024 (ha a modell nagyon beragad a szövegbe, vedd le akár 384-ig)
Repetition Penalty: 1.03 vagy 1.1 (1.03 esetén simulékonyabb, 1.1-gyel kicsit radikálisabb és logikusabb)
Presence Penalty: 0 (maximum 0.1-ig menj fel, illetve 0.5 jó a modell kizökkentésére)
A Hagyományos mód értékei eltérnek az eredeti modelltől a magyar nyelv ragozásai miatt. Érdemes teljesen szabadon engedni (Top-P, Top-K, Min-P), tapasztalataim szerint jobb lesz a szöveg ezek nélkül, de kinek mi a szimpatikus. Ettől függetlenül mindkét modellnél próbáld ki még az alábbi beállítást is, bár a tesztjeim szerint izgalmas válaszok születnek:
Ezekkel a beállításokkal jó szöveget kell adnia, ha a ragozás sok helyen szétesik vagy nem jól válaszol, akkor ellenőrizd a System promptot, rövidítsd a karakterlapot, ellenőrizd a beírt válaszodat! Ha találsz jobb paramétereket, a programod megjelölésével jöhetnek kommentbe!
Tippek:
Általában érdemes a két beállítás-típust kombinálni úgy, hogy ha a Mirostat kezd hurokba fordulni (loopolni, ismételni, azaz hasonló a szöveg mintázata), akkor érdemes kicsit kizökkenteni a hagyományos paraméterek használatával (alább van pár minta), majd pár válasz után visszalépni a Mirostat-os módba. Szerencsére a legtöbb LLM program már támogatja a paraméter-profilok mentését, így pár kattintással vissza lehet jutni.
Ha nagyon loopolna (ismételne, kergetőzne), a Repeat Penalty Range értéket emeld nagyobbra vagy kisebbre (384-4096-ig, alapból 2048 ajánlott).
Ha nem jó választ kapnál, generáld újra, általában második-harmadik esetben már jó válaszokat kapsz, de ez a szóhasználattól, system prompttól, valamint karakterlaptól is erősen függ!
Roleplay/szerepjáték: Stheno modellel jobban működik. Válasznál javaslom, hogy legalább két ponton erősítsd meg, hogy mit választasz a stabilabb folytatásért. Például: "A kettest választom, a lelakatolt ajtót." A System promptba vagy a karakterlap elejére érdemes beírni egy ilyen szöveget is: "Ez egy szerepjáték, a válaszaid végén mindig adj 2-5 számozott lehetőséget!"
További tervek
a datasetek javítása: ez lassú munka, mert nem csak nyelvtanilag és fogalmazásban, helyesírásban kell átnéznem, hanem igyekszem a Gemini által generált mintákat is "zajosítani" (sokszor hasonló szöveget, történetet generált, amit a képzés során átvehetett). Igyekszem természetesebbé tenni a mintákat.
más 7-9B-s modellek edzése (például Magnum, Qwen) a tisztított datasetekkel.
4B-s modellek nincsenek tervben. Qwen3 4B-vel kísérleteztem, de olyan kicsi a modell edzhető területe, hogy igencsak szűkre kellene állítani a generálási paramétereket, hogy viszonylag releváns válaszokat kapjak (a helyes ragozás pedig álom). Lorával ezt nem tudom megtörni, csak egy teljes finetune oldhatná fel ezt a problémát, amihez nincs elég datasetem, sem pénzem, sem időm, sajnálom.
datasetek megosztása, amikor úgy érzem, kipucoltam ezeket. Figyelem, ezek (időnként durva és nem konszenzusos) nsfw párbeszédeket és szituációkat is tartalmaznak, szóval még kitalálom, hogyan oszthatom meg.