Views
No views yet
1# 예상 출력
2"오늘은 좋은 날입니다."
3
4# 실제 출력
5"Hôm nay là một ngày tốt lành."1# 프롬프트
2"오늘의 연애운을 알려주세요."
3
4# v4-tshirt 출력 (반복 발생)
5"오늘은 좋은 날입니다. 오늘은 좋은 날입니다. 오늘은 좋은 날입니다. 오늘은 좋은 날입니다..."1# 1. 임베딩 기반 difficulty 측정
2embeddings = embed_model.encode(training_samples)
3difficulty_scores = calculate_difficulty(embeddings)
4
5# 2. 상위 20% 선택
6threshold = np.percentile(difficulty_scores, 80)
7selected_samples = samples[difficulty_scores >= threshold]
8
9# 3. 선택된 샘플로 학습
10# 문제: 다양성 부족 → 반복 루프 발생tellang/yeji-8b-rslora-v7-AWQ1from vllm import LLM, SamplingParams
2
3llm = LLM(
4 model="tellang/yeji-8b-rslora-v7-AWQ",
5 quantization="awq",
6)
7
8# 반복 방지 설정
9sampling_params = SamplingParams(
10 temperature=0.7,
11 top_p=0.9,
12 max_tokens=512,
13 repetition_penalty=1.05, # v4에서는 효과 없었음, v7에서는 정상 작동
14)tellang/yeji-4b-rslora-v8.1 (전체 데이터 학습)tellang/yeji-8b-rslora-v7-AWQ (전체 데이터 학습)| 지표 | v4-tshirt (20% 데이터) | v7-AWQ (100% 데이터) |
|---|---|---|
| 학습 샘플 | 1,000 (20%) | 5,000 (100%) |
| 학습 시간 | 2시간 | 10시간 |
| 반복 루프 | 30% 발생 | <1% 발생 |
| 베트남어 출력 | 15-20% | <1% |
| 다양성 | 낮음 | 높음 |
| 정확도 | Baseline | +15% |
| 측면 | 논문 (ImageNet) | YEJI (운세 데이터) |
|---|---|---|
| 데이터 규모 | 100만+ 샘플 | 5,000 샘플 |
| 20% 선택 시 | 20만 샘플 (충분) | 1,000 샘플 (부족) |
| 다양성 | 유지됨 | 심각하게 감소 |
| 결과 | ✅ 성공 | ❌ 실패 |
1# Back-translation으로 데이터 증강
2ko → en → ko # 동일 의미, 다른 표현1# v4-tshirt - 반복 루프 발생
2llm = LLM(model="tellang/yeji-8b-lora-v4-tshirt")
3output = llm.generate("오늘의 운세는?")
4# 출력: "오늘은 좋은 날입니다. 오늘은 좋은 날입니다..." ❌1# v7-AWQ - 정상 출력
2llm = LLM(model="tellang/yeji-8b-rslora-v7-AWQ", quantization="awq")
3
4sampling_params = SamplingParams(
5 temperature=0.7,
6 repetition_penalty=1.05,
7)
8
9output = llm.generate("오늘의 운세는?", sampling_params)
10# 출력: "오늘은 긍정적인 에너지가 가득한 날입니다. 새로운 기회를 만나게 될 것입니다." ✅1@misc{yeji-8b-lora-v4-tshirt,
2 title={YEJI Fortune Telling Model (T-SHIRT v4 - Deprecated)},
3 author={SSAFY YEJI Team},
4 year={2026},
5 note={Deprecated: Repetition loop and Vietnamese output. Use yeji-8b-rslora-v7-AWQ instead}
6}