Premium FP8 quantization with 2,048 code-optimized calibration samples
This is a premium FP8 quantized version of microsoft/NextCoder-14B featuring rigorous code-optimized multi-dataset calibration for production-grade reliability. Quantized by TevunahAi on enterprise-grade hardware.
🎯 Recommended Usage: vLLM
For optimal performance with full FP8 benefits and code-optimized quality, use vLLM or TensorRT-LLM:
Quick Start with vLLM
pip install vllm
Python API:
python
1from vllm import LLM, SamplingParams
2from transformers import AutoTokenizer
34# vLLM auto-detects FP8 from model config5llm = LLM(model="TevunahAi/NextCoder-14B-2048-Calibration-FP8", dtype="auto")67# Prepare prompt with chat template8tokenizer = AutoTokenizer.from_pretrained("TevunahAi/NextCoder-14B-2048-Calibration-FP8")9messages =[{"role":"user","content":"Write a Python function to calculate fibonacci numbers"}]10prompt = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)1112# Generate13sampling_params = SamplingParams(temperature=0.7, max_tokens=512)14outputs = llm.generate([prompt], sampling_params)1516for output in outputs:17print(output.outputs[0].text)
OpenAI-Compatible API Server:
bash
1vllm serve TevunahAi/NextCoder-14B-2048-Calibration-FP8 \2 --dtype auto \3 --max-model-len 4096
Then use with OpenAI client:
python
1from openai import OpenAI
23client = OpenAI(4 base_url="http://localhost:8000/v1",5 api_key="token-abc123",# dummy key6)78response = client.chat.completions.create(9 model="TevunahAi/NextCoder-14B-2048-Calibration-FP8",10 messages=[11{"role":"user","content":"Write a Python function to calculate fibonacci numbers"}12],13 temperature=0.7,14 max_tokens=512,15)1617print(response.choices[0].message.content)
vLLM Benefits
✅ Weights, activations, and KV cache in FP8
✅ ~14GB VRAM (50% reduction vs BF16)
✅ Native FP8 tensor core acceleration on Ada/Hopper GPUs
✅ Single GPU deployment on RTX 4090, RTX 5000 Ada, or H100
✅ Premium 2048-sample code-optimized calibration
✅ Production-grade code quality
⚙️ Alternative: Transformers (Not Recommended)
This model can be loaded with transformers, but will decompress FP8 → BF16 during inference, requiring ~28GB+ VRAM. For 14B models, vLLM is strongly recommended.
Transformers Example (Click to expand)
python
1from transformers import AutoModelForCausalLM, AutoTokenizer
2import torch
34# Loads FP8 weights but decompresses to BF16 during compute5model = AutoModelForCausalLM.from_pretrained(6"TevunahAi/NextCoder-14B-2048-Calibration-FP8",7 device_map="auto",8 torch_dtype="auto",9 low_cpu_mem_usage=True,10)11tokenizer = AutoTokenizer.from_pretrained("TevunahAi/NextCoder-14B-2048-Calibration-FP8")1213# Generate14messages =[{"role":"user","content":"Write a Python function to calculate fibonacci numbers"}]15text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)16inputs = tokenizer([text], return_tensors="pt").to(model.device)1718outputs = model.generate(**inputs, max_new_tokens=512)19print(tokenizer.decode(outputs[0], skip_special_tokens=True))