Views
No views yet
| Name | Quant method | Size |
|---|---|---|
| L3-8B-Stheno-v3.3-32K.Q2_K.gguf | Q2_K | 2.96GB |
| L3-8B-Stheno-v3.3-32K.IQ3_XS.gguf | IQ3_XS | 3.28GB |
| L3-8B-Stheno-v3.3-32K.IQ3_S.gguf | IQ3_S | 3.43GB |
| L3-8B-Stheno-v3.3-32K.Q3_K_S.gguf | Q3_K_S | 3.41GB |
| L3-8B-Stheno-v3.3-32K.IQ3_M.gguf | IQ3_M | 3.52GB |
| L3-8B-Stheno-v3.3-32K.Q3_K.gguf | Q3_K | 3.74GB |
| L3-8B-Stheno-v3.3-32K.Q3_K_M.gguf | Q3_K_M | 3.74GB |
| L3-8B-Stheno-v3.3-32K.Q3_K_L.gguf | Q3_K_L | 4.03GB |
| L3-8B-Stheno-v3.3-32K.IQ4_XS.gguf | IQ4_XS | 4.18GB |
| L3-8B-Stheno-v3.3-32K.Q4_0.gguf | Q4_0 | 4.34GB |
| L3-8B-Stheno-v3.3-32K.IQ4_NL.gguf | IQ4_NL | 4.38GB |
| L3-8B-Stheno-v3.3-32K.Q4_K_S.gguf | Q4_K_S | 4.37GB |
| L3-8B-Stheno-v3.3-32K.Q4_K.gguf | Q4_K | 4.58GB |
| L3-8B-Stheno-v3.3-32K.Q4_K_M.gguf | Q4_K_M | 4.58GB |
| L3-8B-Stheno-v3.3-32K.Q4_1.gguf | Q4_1 | 4.78GB |
| L3-8B-Stheno-v3.3-32K.Q5_0.gguf | Q5_0 | 5.21GB |
| L3-8B-Stheno-v3.3-32K.Q5_K_S.gguf | Q5_K_S | 5.21GB |
| L3-8B-Stheno-v3.3-32K.Q5_K.gguf | Q5_K | 5.34GB |
| L3-8B-Stheno-v3.3-32K.Q5_K_M.gguf | Q5_K_M | 5.34GB |
| L3-8B-Stheno-v3.3-32K.Q5_1.gguf | Q5_1 | 5.65GB |
| L3-8B-Stheno-v3.3-32K.Q6_K.gguf | Q6_K | 6.14GB |
| L3-8B-Stheno-v3.3-32K.Q8_0.gguf | Q8_0 | 7.95GB |


sequence_len: 8192
use_pose: true
pose_max_context_len: 32768
overrides_of_model_config:
rope_theta: 2000000.0
max_position_embeddings: 32768
# peft_use_dora: true
adapter: lora
peft_use_rslora: true
lora_model_dir:
lora_r: 256
lora_alpha: 256
lora_dropout: 0.1
lora_target_linear: true
lora_target_modules:
- gate_proj
- down_proj
- up_proj
- q_proj
- v_proj
- k_proj
- o_proj
warmup_steps: 80
gradient_accumulation_steps: 6
micro_batch_size: 1
num_epochs: 2
optimizer: adamw_bnb_8bit
lr_scheduler: cosine_with_min_lr
learning_rate: 0.00004
lr_scheduler_kwargs:
min_lr: 0.000004