Korean News Clickbait Classification Embeddings
데이터셋 설명
한국어 뉴스 제목의 낚시성(clickbait) 분류를 위한 SBERT 임베딩 데이터셋입니다.
이 데이터셋은 한국어 뉴스 기사의 제목과 본문을 SBERT 모델로 임베딩한 결과물로,
딥러닝 모델 학습에 바로 사용할 수 있도록 전처리되어 있습니다.
임베딩 모델: snunlp/KR-SBERT-V40K-klueNLI-augSTS
임베딩 차원: 768
언어: 한국어 (Korean)
정규화: L2 normalized (코사인 유사도 계산에 최적화)
title_embeddings: (N, 768) - 제목(title) 임베딩
content_embeddings: (N, 768) - 본문(content) 임베딩
labels: (N,) - 레이블… See the full description on the dataset page:
https://huggingface.co/datasets/jjanoong2/clickbait_embeddings.