Views
No views yet
bfloat16 (Daha verimli bellek kullanımı ve hızlı çıkarım için)~338 Milyon


transformers kütüphanesi ile saniyeler içinde projene dahil edebilirsin.pip install transformers torch1from transformers import AutoModelForCausalLM, AutoTokenizer
2import torch
3
4# Modelin repo adı
5model_id = "syko818121/SykoLLM-V4.4"
6
7# Tokenizer ve Modeli yükleme
8tokenizer = AutoTokenizer.from_pretrained(model_id)
9model = AutoModelForCausalLM.from_pretrained(
10 model_id,
11 torch_dtype=torch.bfloat16,
12 device_map="auto"
13)
14
15# Test metni
16user_message = "6 + 6 kaç eder?"
17
18# Llama 3 orijinal chat template'inin manuel olarak eklenmesi
19# user ve assistant rolleri ile special token'lar korundu
20prompt = (
21 f"<|begin_of_text|><|start_header_id|>user<|end_header_id|>\n\n"
22 f"{user_message}<|eot_id|><|start_header_id|>assistant<|end_header_id|>\n\n"
23)
24
25inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
26
27# Metin üretimi
28outputs = model.generate(
29 **inputs,
30 max_new_tokens=100,
31 temperature=0.15,
32 top_p=0.9,
33 early_stopping=True,
34 repetition_penalty=1.16,
35 do_sample=False
36)
37
38# Çıktıyı decode etme
39response = tokenizer.decode(outputs[0], skip_special_tokens=True)
40
41# Sadece asistanın verdiği cevabı temiz bir şekilde alma
42final_response = response.split("assistant\n\n")[-1].strip()
43
44print(final_response)