Views
No views yet
| Name | Quant method | Size |
|---|---|---|
| Mistral-v0.3-6B.Q2_K.gguf | Q2_K | 2.09GB |
| Mistral-v0.3-6B.IQ3_XS.gguf | IQ3_XS | 2.32GB |
| Mistral-v0.3-6B.IQ3_S.gguf | IQ3_S | 2.44GB |
| Mistral-v0.3-6B.Q3_K_S.gguf | Q3_K_S | 2.43GB |
| Mistral-v0.3-6B.IQ3_M.gguf | IQ3_M | 2.52GB |
| Mistral-v0.3-6B.Q3_K.gguf | Q3_K | 2.69GB |
| Mistral-v0.3-6B.Q3_K_M.gguf | Q3_K_M | 2.69GB |
| Mistral-v0.3-6B.Q3_K_L.gguf | Q3_K_L | 2.92GB |
| Mistral-v0.3-6B.IQ4_XS.gguf | IQ4_XS | 3.02GB |
| Mistral-v0.3-6B.Q4_0.gguf | Q4_0 | 3.15GB |
| Mistral-v0.3-6B.IQ4_NL.gguf | IQ4_NL | 3.18GB |
| Mistral-v0.3-6B.Q4_K_S.gguf | Q4_K_S | 3.17GB |
| Mistral-v0.3-6B.Q4_K.gguf | Q4_K | 3.34GB |
| Mistral-v0.3-6B.Q4_K_M.gguf | Q4_K_M | 3.34GB |
| Mistral-v0.3-6B.Q4_1.gguf | Q4_1 | 3.48GB |
| Mistral-v0.3-6B.Q5_0.gguf | Q5_0 | 3.82GB |
| Mistral-v0.3-6B.Q5_K_S.gguf | Q5_K_S | 3.82GB |
| Mistral-v0.3-6B.Q5_K.gguf | Q5_K | 3.92GB |
| Mistral-v0.3-6B.Q5_K_M.gguf | Q5_K_M | 3.92GB |
| Mistral-v0.3-6B.Q5_1.gguf | Q5_1 | 4.16GB |
| Mistral-v0.3-6B.Q6_K.gguf | Q6_K | 4.54GB |
| Mistral-v0.3-6B.Q8_0.gguf | Q8_0 | 5.88GB |
0.4.01base_model: pszemraj/Mistral-7B-v0.3-prune6
2model_type: MistralForCausalLM
3tokenizer_type: LlamaTokenizer
4
5strict: false
6seed: 80085
7max_steps: 2000
8# dataset
9datasets:
10 - path: BEE-spoke-data/knowledge-inoc-concat-v1
11 name: smorgasbord-tb-quality
12 type: completion
13 field: text
14val_set_size: 0.01
15
16sequence_len: 4096
17sample_packing: true
18pad_to_sequence_len: false
19train_on_inputs: false
20group_by_length: false
21
22# WANDB
23wandb_project: llama3-pruning
24wandb_entity: pszemraj
25wandb_watch: gradients
26wandb_name: Mistral-6B-v0.3-v0.1-ii
27hub_model_id: pszemraj/Mistral-v0.3-6B-ii
28hub_strategy: every_save
29
30gradient_accumulation_steps: 16
31micro_batch_size: 1
32num_epochs: 1
33optimizer: paged_adamw_32bit
34weight_decay: 0.1
35lr_scheduler: cosine
36learning_rate: 2e-5
37warmup_ratio: 0.1
38
39load_in_8bit: false
40load_in_4bit: false
41bfloat16: true
42tf32: true
43
44flash_attention: true
45torch_compile: true
46torch_compile_backend: inductor
47gradient_checkpointing: true
48gradient_checkpointing_kwargs:
49 use_reentrant: false
50
51# hyperparams for freq of evals, saving, etc
52evals_per_epoch: 5
53saves_per_epoch: 5
54save_safetensors: true
55save_total_limit: 1
56output_dir: /workspace/output-axolotl/output-model-6b
57logging_steps: 6
58
59deepspeed:
60
61special_tokens:
62| Tasks | Version | Filter | n-shot | Metric | Value | Stderr | |
|---|---|---|---|---|---|---|---|
| arc_easy | 1 | none | 0 | acc | 0.7109 | ± | 0.0093 |
| none | 0 | acc_norm | 0.6654 | ± | 0.0097 | ||
| boolq | 2 | none | 0 | acc | 0.7930 | ± | 0.0071 |
| lambada_openai | 1 | none | 0 | perplexity | 4.9892 | ± | 0.1269 |
| none | 0 | acc | 0.6746 | ± | 0.0065 | ||
| openbookqa | 1 | none | 0 | acc | 0.2460 | ± | 0.0193 |
| none | 0 | acc_norm | 0.3700 | ± | 0.0216 | ||
| piqa | 1 | none | 0 | acc | 0.7350 | ± | 0.0103 |
| none | 0 | acc_norm | 0.7350 | ± | 0.0103 | ||
| winogrande | 1 | none | 0 | acc | 0.6930 | ± | 0.0130 |
| Training Loss | Epoch | Step | Validation Loss |
|---|---|---|---|
| No log | 0.0002 | 1 | 1.5980 |
| 1.578 | 0.0955 | 400 | 1.4028 |
| 1.5828 | 0.1911 | 800 | 1.3809 |
| 1.4355 | 0.2866 | 1200 | 1.3152 |
| 1.4618 | 0.3822 | 1600 | 1.2877 |
| 1.4551 | 0.4777 | 2000 | 1.2860 |
| Metric | Value |
|---|---|
| Avg. | 49.23 |
| AI2 Reasoning Challenge (25-Shot) | 45.14 |
| HellaSwag (10-Shot) | 71.65 |
| MMLU (5-Shot) | 51.83 |
| TruthfulQA (0-shot) | 45.64 |
| Winogrande (5-shot) | 72.77 |
| GSM8k (5-shot) | 8.34 |
| Metric | Value |
|---|---|
| Avg. | 10.03 |
| IFEval (0-Shot) | 24.54 |
| BBH (3-Shot) | 13.52 |
| MATH Lvl 5 (4-Shot) | 0.83 |
| GPQA (0-shot) | 2.01 |
| MuSR (0-shot) | 6.61 |
| MMLU-PRO (5-shot) | 12.70 |