Premium FP8 quantization with 1,024-sample calibration across 4 diverse datasets
This is a premium FP8 quantized version of openai/gpt-oss-120b featuring rigorous multi-dataset calibration for production-grade reliability. Quantized by TevunahAi on enterprise-grade hardware.
🎯 Recommended Usage: vLLM
For optimal performance with full FP8 benefits and efficient MoE routing, use vLLM or TensorRT-LLM:
✅ Native FP8 tensor core acceleration on Ada/Hopper GPUs
✅ Efficient MoE routing - only 5B active per token
✅ 120B model capability at 5B model speed
✅ Premium 1024-sample calibration for production reliability
⚠️ Transformers: Not Practical
This model can be loaded with transformers, but will decompress FP8 → BF16 during inference, requiring significant VRAM. For large MoE models, vLLM is strongly recommended.
Transformers Example (Not Recommended - Click to expand)
This model was quantized using TevunahAi's premium multi-dataset calibration process:
Calibration Details
Total Samples: 1,024 (4x industry standard)
Datasets Used: 4 complementary sources
Coverage: Comprehensive across all use cases
Dataset
Samples
Purpose
Open-Platypus
256
STEM reasoning and logic
UltraChat-200k
256
Natural conversations
OpenHermes-2.5
256
Instruction following
SlimOrca
256
Diverse general tasks
Why Premium Calibration?
Most FP8 quantizations use 128-512 samples from a single dataset. TevunahAi uses 1,024 samples across 4 diverse datasets, ensuring:
✅ Superior robustness across task types
✅ Better statistical coverage for quantization scales
✅ Minimal quality loss compared to FP16
✅ Production-grade reliability
✅ Consistent performance on edge cases
When quality matters, choose TevunahAi premium calibration quantizations.
🚀 MoE Architecture
GPT-OSS-120B uses an advanced Mixture of Experts (MoE) architecture:
How it works:
120B total parameters split across expert networks
Router network selects which experts to activate
5B active parameters per token (sparse activation)
Result: 120B model knowledge with 5B model speed
Benefits:
✅ Massive parameter count without massive compute
✅ Specialist experts for different types of knowledge
✅ Better quality-per-parameter ratio than dense models
✅ More accessible than equivalent dense models
With FP8 + MoE:
~60GB VRAM (vs ~240GB for FP16 dense equivalent)
Inference speed comparable to 5B dense models
Performance approaching 120B dense models
🔧 Why FP8 for Large MoE Models?
With vLLM/TensorRT-LLM:
✅ 50% memory reduction vs BF16 (~120GB → ~60GB)
✅ Dual RTX 4090 deployment or single A100 80GB / H100 80GB
✅ Faster inference via native FP8 tensor cores
✅ Efficient MoE routing - optimal for sparse activation
✅ 120B capability at 5B speed - best of both worlds
The MoE Advantage:
Total Parameters: 120B (full model capability)
Active Parameters: 5B per token (fast inference)
Memory: ~60GB with FP8 (accessible on high-end prosumer hardware)
Speed: Similar to dense 5B models
Quality: Comparable to dense 120B models
FP8 + Premium Calibration + MoE = flagship model performance on workstation hardware.
💾 Model Files
This model is sharded into multiple safetensors files (all required for inference). The compressed format enables efficient storage and faster downloads.
This 120B MoE model required ~310GB of RAM during quantization — pushing our professional hardware to its limits. This level of rigorous calibration would be impossible on consumer hardware.
Professional AI Model Quantization by TevunahAi
Premium multi-dataset calibration on enterprise-grade infrastructure