1LoRA Configuration:
2 rank: 16
3 alpha: 32
4 dropout: 0.1
5 target_modules:
6 - q_proj
7 - k_proj
8 - v_proj
9 - o_proj
10 - gate_proj
11 - up_proj
1from transformers import AutoTokenizer, AutoModelForCausalLM
2from peft import PeftModel
3import torch
4
5# Загрузка базовой модели
6base_model_name = "meta-llama/Llama-3.2-3B-Instruct"
7model = AutoModelForCausalLM.from_pretrained(
8 base_model_name,
9 torch_dtype=torch.bfloat16,
10 device_map="auto"
11)
12
13# Загрузка LoRA адаптера
14model = PeftModel.from_pretrained(model, "Aze4ka/projectme")
15
16# Загрузка токенизатора
17tokenizer = AutoTokenizer.from_pretrained("Aze4ka/projectme")
18
19# Функция генерации ответа
20def generate_response(prompt, max_new_tokens=100, temperature=0.7):
21 # Форматирование в стиле LLaMA 3.2
22 formatted_prompt = f"<|begin_of_text|><|start_header_id|>user<|end_header_id|>\n\n{prompt}<|eot_id|><|start_header_id|>assistant<|end_header_id|>\n\n"
23
24 inputs = tokenizer(formatted_prompt, return_tensors="pt")
25
26 with torch.no_grad():
27 outputs = model.generate(
28 **inputs,
29 max_new_tokens=max_new_tokens,
30 temperature=temperature,
31 top_p=0.9,
32 do_sample=True,
33 pad_token_id=tokenizer.pad_token_id,
34 eos_token_id=tokenizer.eos_token_id
35 )
36
37 response = tokenizer.decode(outputs[0][inputs['input_ids'].shape[1]:], skip_special_tokens=True)
38 return response.strip()
39
40# Пример использования
41response = generate_response("Привет! Как дела?")
42print(response)
1@misc{llama32-personalized-2025,
2 title={LLaMA 3.2 3B Персонализированная модель},
3 author={Aze4ka},
4 year={2025},
5 publisher={HuggingFace},
6 url={https://huggingface.co/Aze4ka/projectme}
7}
Эта модель лицензирована в соответствии с
LLaMA 3.2 Community License.