Views
No views yet

| Your GPU | Recommended quant | Weights |
|---|---|---|
| RTX 3090 / 4090 / 5090 (24 GB) | Q8_0 | ~3.3 GB |
| RTX 4080 / 5080 / 4060 Ti 16G (16 GB) | Q6_K | ~2.6 GB |
| RTX 3060 / 4070 / 5070 (12 GB) | Q5_K_M | ~2.3 GB |
| RTX 4060 / 3070 (8 GB) | Q4_K_M | ~2.0 GB |
| GTX 1660 Super / 2060 / 3050 laptop (6 GB) | IQ4_XS | ~1.9 GB |
| CPU-only / Apple Silicon | Q4_K_M | fits in system RAM |
Made with ❤️ by RACER IS OP — follow for more uncensored models
| File | Format | Size |
|---|---|---|
SmolLM3-3B-heretic-F16.gguf | GGUF F16 | 5.74 GB |
SmolLM3-3B-heretic-Q2_K.gguf | GGUF Q2_K | 1.17 GB |
SmolLM3-3B-heretic-IQ3_S.gguf | GGUF IQ3_S | 1.34 GB |
SmolLM3-3B-heretic-Q3_K_S.gguf | GGUF Q3_K_S | 1.33 GB |
SmolLM3-3B-heretic-Q3_K_M.gguf | GGUF Q3_K_M | 1.46 GB |
SmolLM3-3B-heretic-Q3_K_L.gguf | GGUF Q3_K_L | 1.57 GB |
SmolLM3-3B-heretic-IQ4_XS.gguf | GGUF IQ4_XS | 1.62 GB |
SmolLM3-3B-heretic-Q4_K_S.gguf | GGUF Q4_K_S | 1.69 GB |
SmolLM3-3B-heretic-Q4_0.gguf | GGUF Q4_0 | 1.68 GB |
SmolLM3-3B-heretic-Q4_1.gguf | GGUF Q4_1 | 1.85 GB |
SmolLM3-3B-heretic-Q4_K_M.gguf | GGUF Q4_K_M | 1.78 GB |
SmolLM3-3B-heretic-Q5_K_S.gguf | GGUF Q5_K_S | 2.01 GB |
SmolLM3-3B-heretic-Q5_K_M.gguf | GGUF Q5_K_M | 2.06 GB |
SmolLM3-3B-heretic-Q6_K.gguf | GGUF Q6_K | 2.36 GB |
SmolLM3-3B-heretic-Q8_0.gguf | GGUF Q8_0 | 3.05 GB |
llama serve -hf saidutta69/SmolLM3-3B-heretic to pull the default quant.1# llama.cpp
2llama serve -hf saidutta69/SmolLM3-3B-heretic1# transformers
2from transformers import AutoModelForCausalLM, AutoTokenizer
3
4model_id = "saidutta69/SmolLM3-3B-heretic"
5tokenizer = AutoTokenizer.from_pretrained(model_id)
6model = AutoModelForCausalLM.from_pretrained(
7 model_id,
8 torch_dtype="auto",
9 device_map="auto",
10)
11
12messages = [{"role": "user", "content": "Write a Python function to merge two sorted lists."}]
13text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
14inputs = tokenizer(text, return_tensors="pt").to(model.device)
15outputs = model.generate(**inputs, max_new_tokens=512, do_sample=False)
16print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[1]:], skip_special_tokens=True))