| 항목 | 값 |
|---|---|
| 아키텍처 | Qwen3Model (hidden 1024, 28 layers, max position 32,768) |
| 포맷 | ONNX, INT8 양자화 — 단일 model.onnx 598 MB |
| 짝 인덱스 | ThakiCloud/superskillret-index |
| 공개 | 2026-05-11 |
1import onnxruntime as ort
2from transformers import AutoTokenizer
3
4tok = AutoTokenizer.from_pretrained("ThakiCloud/superskillret-onnx-int8")
5sess = ort.InferenceSession("model.onnx", providers=["CPUExecutionProvider"])
6
7enc = tok(["슬랙에 오늘 배포 결과 올려줘"], return_tensors="np", padding=True)
8out = sess.run(None, {k: v for k, v in enc.items() if k in {i.name for i in sess.get_inputs()}})superskillret-index 의 빌드 설정을 그대로 따르세요).ThakiCloud/SKILLRET-Embedding-0.6B
(동급 크기, SkillRet 벤치마크로 학습·평가) 를 쓰고, 이 repo 는 CPU 전용 제약이 있을 때만
쓰세요.