Views
No views yet
1Input Text: 아 롤하는데 한타에서 졌어
2Generated Text: 아 리그 오브 레전드하는데 대규모 교전에서 졌어1training_args = TrainingArguments(
2 output_dir="your dir",
3 evaluation_strategy="steps",
4 eval_steps=10000,
5 save_strategy="steps",
6 save_steps=10000,
7 learning_rate=2e-5,
8 per_device_train_batch_size=10,
9 per_device_eval_batch_size=8,
10 logging_dir="your dir",
11 num_train_epochs=5,
12 weight_decay=0.01,
13 fp16=True,
14 report_to="none",
15 logging_steps=1000,
16 warmup_steps=500,
17 lr_scheduler_type="linear",
18 load_best_model_at_end=True,
19 metric_for_best_model="eval_loss",
20)
21• GPU: NVIDIA RTX A5000
• 학습 시간: 8시간| Step | Training Loss | Validation Loss |
|---|---|---|
| 100000 | 0.0591000 | 0.047132 |
| 200000 | 0.0303000 | 0.024423 |
| 300000 | 0.0208000 | 0.017365 |
| 400000 | 0.0159000 | 0.013130 |
| 500000 | 0.0129000 | 0.011025 |
| 5900000 | 0.0002000 | 0.007907 |
| 6000000 | 0.0002000 | 0.007920 |
| 6100000 | 0.0002000 | 0.007869 |
1from transformers import PreTrainedTokenizerFast, BartForConditionalGeneration
2
3MODEL_NAME = "hongggggggggggg/korea-slang-translator-kobert"
4tokenizer = PreTrainedTokenizerFast.from_pretrained(MODEL_NAME)
5model = BartForConditionalGeneration.from_pretrained(MODEL_NAME)
6
7# 테스트 입력 데이터
8input_text = "아 롤하는데 한타에서 졌어"
9
10# 입력 텍스트를 토크나이즈
11input_ids = tokenizer.encode(input_text, return_tensors="pt")
12
13# 모델 추론
14output_ids = model.generate(input_ids, max_length=50, num_beams=4, early_stopping=True)
15
16# 생성된 텍스트 디코딩
17output_text = tokenizer.decode(output_ids, skip_special_tokens=True)
18
19# 결과 출력
20print("Input Text:", input_text)
21print("Generated Text:", output_text)1Input Text: 아 롤하는데 한타에서 졌어
2Generated Text: 아 리그 오브 레전드하는데 대규모 교전에서 졌어1training_args = TrainingArguments(
2 output_dir="your dir",
3 evaluation_strategy="steps",
4 eval_steps=10000,
5 save_strategy="steps",
6 save_steps=10000,
7 learning_rate=2e-5,
8 per_device_train_batch_size=10,
9 per_device_eval_batch_size=8,
10 logging_dir="your dir",
11 num_train_epochs=5,
12 weight_decay=0.01,
13 fp16=True,
14 report_to="none",
15 logging_steps=1000,
16 warmup_steps=500,
17 lr_scheduler_type="linear",
18 load_best_model_at_end=True,
19 metric_for_best_model="eval_loss",
20)| Step | Training Loss | Validation Loss |
|---|---|---|
| 100000 | 0.0591000 | 0.047132 |
| 200000 | 0.0303000 | 0.024423 |
| 300000 | 0.0208000 | 0.017365 |
| 400000 | 0.0159000 | 0.013130 |
| 500000 | 0.0129000 | 0.011025 |
| 5900000 | 0.0002000 | 0.007907 |
| 6000000 | 0.0002000 | 0.007920 |
| 6100000 | 0.0002000 | 0.007869 |
1from transformers import PreTrainedTokenizerFast, BartForConditionalGeneration
2
3MODEL_NAME = "hongggggggggggg/korea-slang-translator-kobert"
4tokenizer = PreTrainedTokenizerFast.from_pretrained(MODEL_NAME)
5model = BartForConditionalGeneration.from_pretrained(MODEL_NAME)
6
7# Test input data
8input_text = "아 롤하는데 한타에서 졌어"
9
10# Tokenize input text
11input_ids = tokenizer.encode(input_text, return_tensors="pt")
12
13# Model inference
14output_ids = model.generate(input_ids, max_length=50, num_beams=4, early_stopping=True)
15
16# Decode generated text
17output_text = tokenizer.decode(output_ids, skip_special_tokens=True)
18
19# Print results
20print("Input Text:", input_text)
21print("Generated Text:", output_text)