Views
No views yet
| Nebula-S-v1 | Nebula-S-v1-4bit | |
|---|---|---|
| Backbone precision | bf16 | 4-bit (nf4) |
| Adapter precision | bf16 | bf16 |
| Backbone size | ~8 GB | ~2 GB |
| Total size | ~9 GB | ~3 GB |
| VRAM needed | ~18 GB | ~6 GB |
| Requires | CUDA / MPS / CPU | CUDA only (bitsandbytes) |
pip install torch transformers>=4.51.0 bitsandbytes accelerate huggingface-hub1from huggingface_hub import snapshot_download
2import sys
3
4snapshot_download("punitdecomp/Nebula-S-v1-4bit", local_dir="./Nebula-S-v1-4bit")
5sys.path.insert(0, "./Nebula-S-v1-4bit")
6from nebula_s import load_nebula_s
7
8model, tokenizer = load_nebula_s("./Nebula-S-v1-4bit", device="cuda")1git lfs install
2git clone https://huggingface.co/punitdecomp/Nebula-S-v1-4bit1import sys
2sys.path.insert(0, "./Nebula-S-v1-4bit")
3from nebula_s import load_nebula_s
4
5model, tokenizer = load_nebula_s("./Nebula-S-v1-4bit", device="cuda")1messages = [{"role": "user", "content": "Solve step by step: what is 17 * 23?"}]
2text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
3inputs = tokenizer(text, return_tensors="pt").to("cuda")
4response = model.generate(
5 inputs["input_ids"], inputs["attention_mask"],
6 tokenizer, max_new_tokens=2048, temperature=0.7
7)
8print(response)