Views
No views yet
Flash Attention 2, bfloat16 ve torch.compile teknolojileri kullanılarak A100 GPU'nun sınırları zorlandı.| Özellik | Değer |
|---|---|
| Model Tipi | Causal Decoder-Only Transformer |
| Parametre Sayısı | ~300 Milyon |
| Context Window | 1024 Token |
| Vocab Size | 50.257 (Özel Türkçe Tokenizer) |
| Eğitim Donanımı | NVIDIA T4 (Pre-train) -> NVIDIA A100 (SFT) |
| Eğitim Formatı | Instruct (User/Assistant) |
trust_remote_code=True parametresi önemlidir.1import torch
2from transformers import AutoModelForCausalLM, AutoTokenizer
3
4model_name = "syko818121/SykoLLM-V3.2-Thinking-Beta-Instruct"
5
6# Model ve Tokenizer Yükleme
7tokenizer = AutoTokenizer.from_pretrained(model_name, trust_remote_code=True)
8model = AutoModelForCausalLM.from_pretrained(
9 model_name,
10 torch_dtype=torch.bfloat16,
11 device_map="auto",
12 trust_remote_code=True
13)
14
15# Prompt Formatı
16system_prompt = "Sen yardımsever bir yapay zeka asistanısın."
17user_input = "Yapay zeka gelecekte dünyayı nasıl değiştirecek?"
18
19prompt = f"### user: {user_input}\n### assistant:"
20
21# Inference
22inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
23
24with torch.no_grad():
25 outputs = model.generate(
26 **inputs,
27 max_new_tokens=256,
28 do_sample=True,
29 temperature=0.7,
30 top_p=0.9,
31 repetition_penalty=1.2,
32 pad_token_id=tokenizer.eos_token_id
33 )
34
35print(tokenizer.decode(outputs[0], skip_special_tokens=True))