Views
No views yet
1from transformers import AutoTokenizer, AutoModelForCausalLM
2
3tokenizer = AutoTokenizer.from_pretrained("google/gemma-2b-it")
4model = AutoModelForCausalLM.from_pretrained(
5 "aiqwe/gemma-2b-it-example-v1",
6 device_map="cuda",
7 torch_dtype=torch.bfloat16,
8 attn_implementation="flash_attention_2"
9)
10
11input_text = "아파트 재건축에 대해 알려줘."
12input_ids = tokenizer(input_text, return_tensors="pt").to("cuda")
13
14outputs = model.generate(**input_ids, max_new_tokens=512)
15print(tokenizer.decode(outputs[0]))
161from transformers import AutoTokenizer, AutoModelForCausalLM
2
3tokenizer = AutoTokenizer.from_pretrained("google/gemma-2b-it")
4model = AutoModelForCausalLM.from_pretrained(
5 "aiqwe/gemma-2b-it-example-v1",
6 device_map="cpu",
7 torch_dtype=torch.bfloat16
8)
9
10input_text = "아파트 재건축에 대해 알려줘."
11input_ids = tokenizer(input_text, return_tensors="pt").to("cuda")
12
13outputs = model.generate(**input_ids, max_new_tokens=512)
14print(tokenizer.decode(outputs[0]))1from transformers import AutoTokenizer, AutoModelForCausalLM
2from utils import generate
3
4tokenizer = AutoTokenizer.from_pretrained("google/gemma-2b-it")
5model = AutoModelForCausalLM.from_pretrained(
6 "aiqwe/gemma-2b-it-example-v1",
7 device_map="cuda",
8 torch_dtype=torch.bfloat16,
9 attn_implementation="flash_attention_2"
10)
11
12rag_config = {
13 "api_client_id": userdata.get('NAVER_API_ID'),
14 "api_client_secret": userdata.get('NAVER_API_SECRET')
15}
16completion = generate(
17 model=model,
18 tokenizer=tokenizer,
19 query=query,
20 max_new_tokens=512,
21 rag=True,
22 rag_config=rag_config
23)
24print(completion)1input_text = "아파트 재건축에 대해 알려줘."
2
3input_text = tokenizer.apply_chat_template(
4 conversation=[
5 {"role": "user", "content": input_text}
6 ],
7 add_generate_prompt=True,
8 return_tensors="pt"
9 ).to(model.device)
10
11outputs = model.generate(input_text, max_new_tokens=512, repetition_penalty = 1.5)
12print(tokenizer.decode(outputs[0], skip_special_tokens=False))| 구분 | 내용 |
|---|---|
| 환경 | Google Colab |
| GPU | L4(22.5GB) |
| 사용 VRAM | 약 13.8GB |
| dtype | bfloat16 |
| Attention | flash attention2 |
| Tuning | Lora(r=4, alpha=32) |
| Learning Rate | 1e-4 |
| LRScheduler | Cosine |
| Optimizer | adamw_torch_fused |
| batch_size | 4 |
| gradient_accumulation_steps | 2 |