language: ko
배달 앱 리뷰 감정 분류(긍,부정) 모델: "KLUE/RoBERTa-base"
- 모델 소개 (Model Description)
이 모델은 배달 애플리케이션의 사용자 리뷰를 긍정(1) 또는 부정(0)으로 분류하기 위해 파인 튜닝된 텍스트 분류 모델입니다. 이 시스템은 기업이 고객의 소리를 실시간으로 모니터링하고 신속하게 대응할 수 있도록 돕습니다.
이 모델은 방대한 한국어 텍스트 코퍼스로 사전 학습된 트랜스포머 모델을 기반으로 하며, 높은 문맥 이해 능력을 갖추고 있습니다.
배달 앱 리뷰의 자동 긍정/부정 분류.
서비스 개선 방향에 대한 정량적 데이터 제공.
학습 데이터셋 (Training Data)
: 이 모델은 다양한 배달 앱 사용자의 말투와 표현을 학습하기 위해 통합 데이터셋을 사용했습니다.
데이터 소스: 배달의민족(1만건:긍정5천건, 부정5천건), 요기요(1만건: 긍정5천건, 부정5천건), 쿠팡이츠(1만건:긍정5천건, 부정5천건)의 통합 리뷰 데이터
데이터 건수: 약 29,000건 (중복 제거, 고유 리뷰)
전처리: 과도한 특수문자 제거 및 임베딩을 활용하여 정규 표현식으로 모델 입력 데이터의 품질을 높였습니다.
- 학습 결과 (Evaluation Results)
최적 모델 선택: Validation Loss가 가장 낮았던 에포크 2의 가중치를 최종 모델로 사용합니다.
사용된 하이퍼파라미터
최대 에포크: 2
조기 종료 (Patience): 2
Learning Rate: 3e-5
Batch Size: 8
Test Size: 0.2 (20%)
모델 정확도 : 95%
from transformers import AutoTokenizer, AutoModelForSequenceClassification, pipeline
model_name = "KLUE/RoBERTa-base"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForSequenceClassification.from_pretrained(model_name, num_labels=2)
classifier = pipeline("text-classification", model=model, tokenizer=tokenizer)
review = "와 진짜 역대급으로 맛있어요. 최고입니다!"
result = classifier(review)
print(f"리뷰: {review} -> 분류: {result[0]['label']} (확률: {result[0]['score']:.2f})")