Views
No views yet
pip install vllm1from vllm import LLM, SamplingParams
2from transformers import AutoTokenizer
3
4# vLLM auto-detects FP8 from model config
5llm = LLM(model="TevunahAi/NextCoder-7B-FP8", dtype="auto")
6
7# Prepare prompt with chat template
8tokenizer = AutoTokenizer.from_pretrained("TevunahAi/NextCoder-7B-FP8")
9messages = [{"role": "user", "content": "Write a Python function to calculate fibonacci numbers"}]
10prompt = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
11
12# Generate
13outputs = llm.generate(prompt, SamplingParams(temperature=0.7, max_tokens=512))
14print(outputs[0].outputs[0].text)1vllm serve TevunahAi/NextCoder-7B-FP8 \
2 --dtype auto \
3 --max-model-len 40961from openai import OpenAI
2
3client = OpenAI(
4 base_url="http://localhost:8000/v1",
5 api_key="token-abc123", # dummy key
6)
7
8response = client.chat.completions.create(
9 model="TevunahAi/NextCoder-7B-FP8",
10 messages=[
11 {"role": "user", "content": "Write a Python function to calculate fibonacci numbers"}
12 ],
13 temperature=0.7,
14 max_tokens=512,
15)
16
17print(response.choices[0].message.content)transformers. Note: Transformers will decompress FP8 → BF16 during inference, losing the memory benefit. However, at 7B parameters, this is manageable (~14GB VRAM).1from transformers import AutoModelForCausalLM, AutoTokenizer
2import torch
3
4# Loads FP8 weights but decompresses to BF16 during compute
5model = AutoModelForCausalLM.from_pretrained(
6 "TevunahAi/NextCoder-7B-FP8",
7 device_map="auto",
8 torch_dtype="auto",
9 low_cpu_mem_usage=True,
10)
11tokenizer = AutoTokenizer.from_pretrained("TevunahAi/NextCoder-7B-FP8")
12
13# Generate code
14messages = [{"role": "user", "content": "Write a Python function to calculate fibonacci numbers"}]
15text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
16inputs = tokenizer([text], return_tensors="pt").to(model.device)
17
18outputs = model.generate(
19 **inputs,
20 max_new_tokens=512,
21 temperature=0.7,
22 do_sample=True
23)
24print(tokenizer.decode(outputs[0], skip_special_tokens=True))pip install torch>=2.1.0 transformers>=4.40.0 accelerate compressed-tensors| Property | Value |
|---|---|
| Base Model | microsoft/NextCoder-7B |
| Quantization Method | FP8 E4M3 weight-only |
| Framework | llm-compressor + compressed_tensors |
| Storage Size | ~7GB (3 sharded safetensors) |
| VRAM (vLLM) | ~7GB |
| VRAM (Transformers) | ~14GB (decompressed to BF16) |
| Target Hardware | NVIDIA Ada (RTX 4000/5000) or Hopper (H100/GH200) |
| Quantization Date | November 22, 2025 |
| Quantization Time | 47 minutes |
model-00001-of-00003.safetensorsmodel-00002-of-00003.safetensorsmodel-00003-of-00003.safetensors1@misc{nextcoder2024,
2 title={NextCoder: Next-Generation Code LLM},
3 author={Microsoft},
4 year={2024},
5 url={https://huggingface.co/microsoft/NextCoder-7B}
6}