Beta
Explore
Marketplace
Neural Labs
Chat
Wallet
Docs
Elbaz-NVIDIA-Nemotron-3-Nano-30B-A3B-PRISM-NVFP4 – AI Model by Ex0bit | AlphaNeural AI
You can deploy this model and start earning money today!
Ex0bit
/
Elbaz-NVIDIA-Nemotron-3-Nano-30B-A3B-PRISM-NVFP4
like
0
transformers
safetensors
nvidia
pytorch
abliteration
PRISM
mamba-2
moe
hybrid
finetune
quantized
text-generation
conversational
en
nvidia/Nemotron-Pretraining-Code-v1
nvidia/Nemotron-CC-v2
nvidia/Nemotron-Pretraining-SFT-v1
nvidia/Nemotron-CC-Math-v1
nvidia/Nemotron-Pretraining-Code-v2
nvidia/Nemotron-Pretraining-Specialized-v1
Views
No views yet
Model card
Files and Versions
Community
API
Deploy
Elbaz-NVIDIA-Nemotron-3-Nano-30B-A3B-PRISM-NVFP4 (UNCENSORED)
NVFP4 Quantized Version for NVIDIA Blackwell GPUs
Model Description
This is the
NVFP4 (FP4) quantized version
of
Ex0bit/Elbaz-NVIDIA-Nemotron-3-Nano-30B-A3B-PRISM
, created using NVIDIA TensorRT Model Optimizer.
Model Size:
~18 GB (4-bit weights)
Requirements
NVFP4 format is optimized for:
NVIDIA Blackwell GPUs
(B100, B200, GB200)
TensorRT-LLM v0.17+
This format is NOT compatible with:
Consumer GPUs (RTX 3000/4000/5000 series)
llama.cpp
Standard PyTorch inference
Usage
With TensorRT-LLM
Deploying NVIDIA Nemotron-3-Nano with TensorRT LLM
Quantization Details
Method:
NVIDIA ModelOpt NVFP4_DEFAULT_CFG
Calibration:
512 samples from WikiText-2
Format:
HuggingFace checkpoint with quantized weights
Related Models
Ex0bit/Elbaz-NVIDIA-Nemotron-3-Nano-30B-A3B-PRISM
- Parent model (GGUF quantizations available)
nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16
- Original base model
Author
Eric Elbaz (Ex0bit)
License
NVIDIA Open Model License