Views
No views yet
| Name | Quant method | Size |
|---|---|---|
| T3Q-ko-solar-sft-v3.0.Q2_K.gguf | Q2_K | 3.73GB |
| T3Q-ko-solar-sft-v3.0.IQ3_XS.gguf | IQ3_XS | 4.14GB |
| T3Q-ko-solar-sft-v3.0.IQ3_S.gguf | IQ3_S | 4.37GB |
| T3Q-ko-solar-sft-v3.0.Q3_K_S.gguf | Q3_K_S | 4.34GB |
| T3Q-ko-solar-sft-v3.0.IQ3_M.gguf | IQ3_M | 4.51GB |
| T3Q-ko-solar-sft-v3.0.Q3_K.gguf | Q3_K | 4.84GB |
| T3Q-ko-solar-sft-v3.0.Q3_K_M.gguf | Q3_K_M | 4.84GB |
| T3Q-ko-solar-sft-v3.0.Q3_K_L.gguf | Q3_K_L | 5.26GB |
| T3Q-ko-solar-sft-v3.0.IQ4_XS.gguf | IQ4_XS | 5.43GB |
| T3Q-ko-solar-sft-v3.0.Q4_0.gguf | Q4_0 | 5.66GB |
| T3Q-ko-solar-sft-v3.0.IQ4_NL.gguf | IQ4_NL | 5.72GB |
| T3Q-ko-solar-sft-v3.0.Q4_K_S.gguf | Q4_K_S | 5.7GB |
| T3Q-ko-solar-sft-v3.0.Q4_K.gguf | Q4_K | 6.02GB |
| T3Q-ko-solar-sft-v3.0.Q4_K_M.gguf | Q4_K_M | 6.02GB |
| T3Q-ko-solar-sft-v3.0.Q4_1.gguf | Q4_1 | 6.27GB |
| T3Q-ko-solar-sft-v3.0.Q5_0.gguf | Q5_0 | 6.89GB |
| T3Q-ko-solar-sft-v3.0.Q5_K_S.gguf | Q5_K_S | 6.89GB |
| T3Q-ko-solar-sft-v3.0.Q5_K.gguf | Q5_K | 7.08GB |
| T3Q-ko-solar-sft-v3.0.Q5_K_M.gguf | Q5_K_M | 7.08GB |
| T3Q-ko-solar-sft-v3.0.Q5_1.gguf | Q5_1 | 7.51GB |
| T3Q-ko-solar-sft-v3.0.Q6_K.gguf | Q6_K | 8.2GB |
| T3Q-ko-solar-sft-v3.0.Q8_0.gguf | Q8_0 | 10.62GB |

1 # 데이터셋과 훈련 횟수와 관련된 하이퍼 파라미터
2 batch_size = 16
3 num_epochs = 1
4 micro_batch = 1
5 gradient_accumulation_steps = batch_size // micro_batch
6
7 # 훈련 방법에 대한 하이퍼 파라미터
8 cutoff_len = 4096
9 lr_scheduler = 'cosine'
10 warmup_ratio = 0.06 # warmup_steps = 100
11 learning_rate = 5e-5
12 optimizer = 'paged_adamw_32bit'
13 weight_decay = 0.01
14 max_grad_norm = 1.0
15
16 # LoRA config
17 lora_r = 16
18 lora_alpha = 16
19 lora_dropout = 0.05
20 lora_target_modules = ["k_proj", "v_proj","gate_proj", "down_proj", "up_proj"]
21
22 # Tokenizer에서 나오는 input값 설정 옵션
23 train_on_inputs = False
24 add_eos_token = False
25
26 # NEFTune params
27 neftune_noise_alpha = 5