Views
No views yet
| Variant | Download | Runtime | Platform |
|---|---|---|---|
| Nebula-S-v1 | ~9 GB | ~9 GB | Universal (bf16) |
| Nebula-S-v1-4bit | ~3 GB | ~3 GB | CUDA only (bnb) |
| Nebula-S-v1-lite | ~3 GB | ~3 GB | Mac + CUDA + CPU |
pip install torch transformers>=4.51.0 hqq huggingface-hub1from huggingface_hub import snapshot_download
2import sys
3
4snapshot_download("punitdecomp/Nebula-S-v1-lite", local_dir="./Nebula-S-v1-lite")
5sys.path.insert(0, "./Nebula-S-v1-lite")
6from nebula_s import load_nebula_s
7
8# Auto-detects device (mps on Mac, cuda on NVIDIA, cpu fallback)
9model, tokenizer = load_nebula_s("./Nebula-S-v1-lite")1git lfs install
2git clone https://huggingface.co/punitdecomp/Nebula-S-v1-lite1import sys
2sys.path.insert(0, "./Nebula-S-v1-lite")
3from nebula_s import load_nebula_s
4
5model, tokenizer = load_nebula_s("./Nebula-S-v1-lite")1messages = [{"role": "user", "content": "Solve step by step: what is 17 * 23?"}]
2text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
3
4device = next(model.parameters()).device
5inputs = tokenizer(text, return_tensors="pt").to(device)
6
7response = model.generate(
8 inputs["input_ids"], inputs["attention_mask"],
9 tokenizer, max_new_tokens=1024, temperature=0.7
10)
11print(response)1# Mac
2model, tokenizer = load_nebula_s("./Nebula-S-v1-lite", device="mps")
3
4# NVIDIA GPU
5model, tokenizer = load_nebula_s("./Nebula-S-v1-lite", device="cuda")
6
7# CPU
8model, tokenizer = load_nebula_s("./Nebula-S-v1-lite", device="cpu")