Views
No views yet
| 파라미터 | 85.4M |
| 아키텍처 | GPT (Decoder-only) |
| 레이어 | 12 |
| 어텐션 헤드 | 12 |
| 임베딩 차원 | 768 |
| 컨텍스트 길이 | 512 |
| 어휘 크기 | 16,384 (BPE) |
| 어텐션 | Flash Attention (SDPA) |
| 정밀도 | float16 |
| 카테고리 | 정확도 |
|---|---|
| 산술 | 100% |
| 코드 트레이싱 | 100% |
| 숫자 성질 | 100% |
| 서술형 | 100% |
| 연산 우선순위 | 88% |
| 리스트 연산 | 83% |
| 괄호 연산 | 80% |
| 방정식 | 80% |
| 논리 | 80% |
| 수열 | 33% |
| 전체 | 86.5% |
pip install torch safetensors tokenizers huggingface_hub1import torch
2from safetensors.torch import load_file
3from tokenizers import Tokenizer
4from huggingface_hub import hf_hub_download
5
6# 다운로드
7model_path = hf_hub_download("SOVYN/SOVYN-85M", "model.safetensors")
8tok_path = hf_hub_download("SOVYN/SOVYN-85M", "tokenizer.json")
9code_path = hf_hub_download("SOVYN/SOVYN-85M", "model.py")
10
11# 아키텍처 로드
12import importlib.util
13spec = importlib.util.spec_from_file_location("model", code_path)
14mod = importlib.util.module_from_spec(spec)
15spec.loader.exec_module(mod)
16
17# 모델 로드
18model = mod.SOVYN85M()
19state_dict = load_file(model_path)
20state_dict = {k: v.float() for k, v in state_dict.items()}
21model.load_state_dict(state_dict)
22model.eval()
23
24tokenizer = Tokenizer.from_file(tok_path)
25
26# 추론
27prompt = "문제: 3x + 7 = 22일 때, x의 값을 구하시오.\n풀이:\n"
28ids = torch.tensor([tokenizer.encode(prompt).ids])
29out = model.generate(ids, max_new_tokens=200, temperature=0.3)
30print(tokenizer.decode(out[0].tolist()))문제: {내용}
풀이: