Views
No views yet
| Файл | Описание |
|---|---|
config.json | конфиг LLM |
model.safetensors | Qwen3-0.6B + LoRA (merged) |
tokenizer.json / tokenizer_config.json | токенизатор |
projector.safetensors | vision-проектор (768→2048→2048→1024) |
clip_vision/ | CLIP ViT-B/32 vision encoder |

1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained(
4 "AuroraSystem/Aurora-Clary-0.6",
5 subfolder="merged", torch_dtype="auto", device_map="auto"
6)
7tok = AutoTokenizer.from_pretrained("AuroraSystem/Aurora-Clary-0.6", subfolder="merged")
8
9prompt = tok.apply_chat_template(
10 [{"role": "user", "content": "Напиши факториал на Python"}],
11 tokenize=False, add_generation_prompt=True
12)
13out = model.generate(tok(prompt, return_tensors="pt").to(model.device), max_new_tokens=200)
14print(tok.decode(out[0], skip_special_tokens=True))Image -> CLIP ViT-B/32 (frozen) -> Projector (768→2048→2048→1024) -> [49 tokens]
Text -> Qwen3 embeddings -> [tokens]
[vision_tokens + text_tokens] -> Qwen3-0.6B -> ответ/think (Qwen3 thinking)| File | Description |
|---|---|
config.json | LLM config |
model.safetensors | Qwen3-0.6B + LoRA (merged) |
tokenizer.json / tokenizer_config.json | tokenizer |
projector.safetensors | vision projector (768→2048→2048→1024) |
clip_vision/ | CLIP ViT-B/32 vision encoder |

1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained(
4 "AuroraSystem/Aurora-Clary-0.6",
5 subfolder="merged", torch_dtype="auto", device_map="auto"
6)
7tok = AutoTokenizer.from_pretrained("AuroraSystem/Aurora-Clary-0.6", subfolder="merged")
8
9prompt = tok.apply_chat_template(
10 [{"role": "user", "content": "Write a Python factorial function"}],
11 tokenize=False, add_generation_prompt=True
12)
13out = model.generate(tok(prompt, return_tensors="pt").to(model.device), max_new_tokens=200)
14print(tok.decode(out[0], skip_special_tokens=True))Image -> CLIP ViT-B/32 (frozen) -> Projector (768→2048→2048→1024) -> [49 tokens]
Text -> Qwen3 embeddings -> [tokens]
[vision_tokens + text_tokens] -> Qwen3-0.6B -> answer/think mode (Qwen3 thinking)