GRPO-дообученная модель для объяснения ML-концептов. Основана на
qwen3.5-4b-ariadna-sft-v1.
*GGUF-версия GRPO v10 требовала отладки совместимости с llama.cpp. Прямой тест через transformers подтверждает полную работоспособность.
Прямое сравнение через llama-server на 100 вопросах (50 базовых + 50 редких из библиотеки статей).
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained(
4 "Rob1234567/qwen3.5-4b-ariadna-grpo-v1",
5 torch_dtype="auto",
6 trust_remote_code=True
7)
8tokenizer = AutoTokenizer.from_pretrained(
9 "Rob1234567/qwen3.5-4b-ariadna-grpo-v1",
10 trust_remote_code=True
11)
12
13prompt = "Attention Mechanism — это"
14inputs = tokenizer(prompt, return_tensors="pt")
15outputs = model.generate(**inputs, max_new_tokens=80, temperature=0.7)
16print(tokenizer.decode(outputs[0]))
Квантизация Q4_K_M (2.6 ГБ) доступна здесь:
qwen3.5-4b-ariadna-grpo-v1-gguf — с полными результатами сравнительного тестирования v1 (SFT) vs v10 (GRPO).