Views
No views yet
Qwen/Qwen2.5-0.5B to achieve high efficiency and low memory footprint.@MrHungLe01 organization:| Training Method | Training Time | VRAM Usage | Evaluation Loss |
|---|---|---|---|
| Full Fine-Tuning | [196.24s] | 10.18GB | [2.041463] |
| LoRA (16-bit) | [228.91s] | 2.88GB | [2.084870] |
| QLoRA (HungLe) | [127.93s] | 1.7GB | [2.208373] |
transformers library:1import torch
2from transformers import AutoModelForCausalLM, AutoTokenizer
3
4model_id = "MrHungLe01/HungLe"
5
6tokenizer = AutoTokenizer.from_pretrained(model_id)
7model = AutoModelForCausalLM.from_pretrained(
8 model_id,
9 torch_dtype=torch.float16,
10 device_map="auto"
11)
12
13prompt = "<|im_start|>user\nXin chào, bạn là ai?<|im_end|>\n<|im_start|>assistant\n"
14inputs = tokenizer(prompt, return_tensors="pt").to("cuda")
15outputs = model.generate(**inputs, max_new_tokens=128, temperature=0.7)
16
17print(tokenizer.decode(outputs[0], skip_special_tokens=True))