Views
No views yet
⚠️ Экспериментальная версия. Учебный/исследовательский прогон без формальной оценки качества — метрики на бенчмарках не снимались (доступен только eval loss в tensorboard-логах обучения). Не предназначена для продакшена.
| Путь | Содержимое |
|---|---|
/ (корень) | merged-модель, bf16 safetensors — для transformers / vLLM |
/lora | LoRA-адаптер (r=32) отдельно — для подключения к базовой модели через PEFT |
/gguf | GGUF для llama.cpp / Ollama: F16, BF16, Q8_0 |
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3repo = "kaufkino/MiniCPM5-1B-T-Wix-ru"
4model = AutoModelForCausalLM.from_pretrained(repo, torch_dtype="bfloat16", device_map="auto")
5tokenizer = AutoTokenizer.from_pretrained(repo)
6
7messages = [{"role": "user", "content": "Расскажи о Санкт-Петербурге"}]
8inputs = tokenizer.apply_chat_template(messages, add_generation_prompt=True, return_tensors="pt").to(model.device)
9out = model.generate(inputs, max_new_tokens=512, temperature=0.7, top_p=0.95, do_sample=True)
10print(tokenizer.decode(out[0][inputs.shape[1]:], skip_special_tokens=True))<think>…</think>), переключается параметром enable_thinking в apply_chat_template. Рекомендации базовой карточки: think — temperature 0.9 / top_p 0.95, no-think — temperature 0.7 / top_p 0.95.llama-cli -m minicpm5-1b-t-wix-ru-q8_0.gguf -cnv -p "Ты полезный ассистент."| Параметр | Значение |
|---|---|
| Метод | LoRA SFT (Unsloth 2026.7.3 + TRL SFTTrainer) |
| LoRA | r=32, alpha=64, dropout=0, все linear-проекции (q/k/v/o/gate/up/down) |
| Эпохи | 2 |
| Контекст | 8192 токенов, packing |
| Батч | 4 × grad_accum 8 = 32 |
| LR | 1e-4, cosine, warmup 3% |
| Оптимизатор | adamw_8bit, weight decay 0.01 |
| Точность | bf16 |
| Данные | T-Wix без english_corpus: ~461k диалогов (~2k отложено на eval) |
/lora), and GGUF F16/BF16/Q8_0 (/gguf). No benchmark evaluation was performed — research artifact, not for production use.