Базовая модель Qwen3.5-4B-Base использует гибридную архитектуру (Gated DeltaNet + Full Attention) с контекстом до 262k токенов, что обеспечивает эффективный инференс при сохранении качества генерации.
Модель дообучалась на датасете
russian-instructions-10k — ~10k русскоязычных пар инструкция-ответ (CC BY-NC 4.0).
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model_name = "LLiserginov/Luqwen-4B"
4
5tokenizer = AutoTokenizer.from_pretrained(model_name, trust_remote_code=True)
6model = AutoModelForCausalLM.from_pretrained(
7 model_name,
8 torch_dtype="auto",
9 device_map="auto",
10 trust_remote_code=True,
11)
12
13messages = [
14 {"role": "user", "content": "Напиши короткий рассказ о коте и луне."},
15]
16
17text = tokenizer.apply_chat_template(
18 messages,
19 tokenize=False,
20 add_generation_prompt=True,
21)
22
23inputs = tokenizer(text, return_tensors="pt").to(model.device)
24
25outputs = model.generate(
26 **inputs,
27 max_new_tokens=1024,
28 temperature=0.7,
29 top_p=0.9,
30 do_sample=True,
31)
32
33response = tokenizer.decode(outputs[0][inputs.input_ids.shape[1]:], skip_special_tokens=True)
34print(response)
1from vllm import LLM, SamplingParams
2
3llm = LLM(model="LLiserginov/Luqwen-4B", trust_remote_code=True)
4
5messages = [
6 {"role": "user", "content": "Объясни разницу между supervised и unsupervised learning."},
7]
8
9outputs = llm.chat(messages, sampling_params=SamplingParams(temperature=0.7, max_tokens=1024))
10print(outputs[0].outputs[0].text)