Views
No views yet
llama.cpp, Ollama, or Python with zero outbound data leakage.| File | Size | Description |
|---|---|---|
model.safetensors | ~2.9 GB | Full unquantized merged model weights (BF16/FP16) |
gguf/quantum_coder_q4_k_m.gguf | ~934 MB | Ultra-fast 4-bit quantized model for llama.cpp / Ollama |
gguf/quantum_coder_f16.gguf | ~2.9 GB | Full-precision 16-bit GGUF model |
tokenizer.json / config.json | - | Standard Hugging Face Transformers configuration files |
./llama-cli -m gguf/quantum_coder_q4_k_m.gguf -p "<|im_start|>user\nWrite a FastAPI rate limiter in Python.<|im_end|>\n<|im_start|>assistant\n" -n 256 --threads 41from transformers import AutoModelForCausalLM, AutoTokenizer
2import torch
3
4model_id = "roadofriot/MindSparQ-Coder-1.5B"
5tokenizer = AutoTokenizer.from_pretrained(model_id)
6model = AutoModelForCausalLM.from_pretrained(model_id, torch_dtype=torch.float16, device_map="auto")
7
8prompt = "<|im_start|>user\nBuild a modern Glassmorphic CSS card token.<|im_end|>\n<|im_start|>assistant\n"
9inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
10outputs = model.generate(**inputs, max_new_tokens=256, temperature=0.3)
11print(tokenizer.decode(outputs[0], skip_special_tokens=False))