Views
No views yet
<think> tags| Format | Size | Use Case |
|---|---|---|
| Q2_K | Smallest | Low memory, reduced quality |
| Q4_K_M | Recommended | Best balance |
| Q5_K_M | Good | Higher quality |
| Q8_0 | Large | Near lossless |
| F16 | Largest | Original precision |
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained("glogwa68/olmo-3-DISTILL-glm-4.7-think")
4tokenizer = AutoTokenizer.from_pretrained("glogwa68/olmo-3-DISTILL-glm-4.7-think")
5
6messages = [{"role": "user", "content": "Hello, how are you?"}]
7inputs = tokenizer.apply_chat_template(messages, return_tensors="pt", add_generation_prompt=True)
8outputs = model.generate(inputs, max_new_tokens=256)
9print(tokenizer.decode(outputs[0], skip_special_tokens=True))ollama run hf.co/glogwa68/olmo-3-DISTILL-glm-4.7-think-GGUF:Q4_K_Mllama-cli --hf-repo glogwa68/olmo-3-DISTILL-glm-4.7-think-GGUF --hf-file olmo-3-distill-glm-4.7-think-q4_k_m.gguf -p "Hello"