Volledige fine-tune (assistant-only loss) van het basismodel op 22.636
Nederlandse instructievoorbeelden over negen taaktypes: instructies volgen,
kort vraag-antwoord, herschrijven naar B1, samenvatten, meerbeurten-chat,
JSON-extractie, gegrond vraag-antwoord, weigeren bij
onzekerheid/privacy, en classificeren/routeren. De tokenizer is uitgebreid
met ChatML-tokens (vocab 32.832); <|im_end|> is het stopteken.
1from transformers import pipeline
2pipe = pipeline("text-generation", model="kamoo-ai/kamoo-one-135m-instruct")
3out = pipe([
4 {"role": "system", "content": "Je bent Kamoo, een behulpzame Nederlandstalige AI-assistent. Antwoord helder, feitelijk en beknopt."},
5 {"role": "user", "content": "Herschrijf naar eenvoudig Nederlands: De aanvraag wordt buiten behandeling gesteld."},
6], max_new_tokens=80)
Geef altijd een systeemprompt mee die de taak stuurt; zonder systeemprompt
kan het model in de verkeerde taakmodus schieten.
Alles wat voor het basismodel geldt (geen betrouwbare parametrische feiten,
alleen Nederlands, 1.024 context), plus specifiek voor deze versie:
Instruction-tuned variant of the from-scratch Dutch 135M model
kamoo-one-135m. ChatML format, stops correctly, strong at format-following
(JSON, register rewriting, summarizing); extraction faithfulness is a known
limitation of the v0.3 templated SFT data. Apache-2.0. Built by
kamoo.