Views
No views yet
1from vllm import LLM, SamplingParams
2
3model_id = "JongYeop/Mistral-7B-Instruct-v0.2-MXFP4-W4A4"
4
5llm = LLM(model=model_id, max_model_len=4096, enforce_eager=True)
6
7outputs = llm.generate(
8 ["The capital of France is"],
9 SamplingParams(max_tokens=64, temperature=0)
10)
11
12for output in outputs:
13 print(output.outputs[0].text)1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model_id = "JongYeop/Mistral-7B-Instruct-v0.2-MXFP4-W4A4"
4
5tokenizer = AutoTokenizer.from_pretrained(model_id)
6model = AutoModelForCausalLM.from_pretrained(
7 model_id,
8 device_map="auto",
9 torch_dtype="auto"
10)
11
12messages = [
13 {"role": "user", "content": "What is machine learning?"}
14]
15
16input_ids = tokenizer.apply_chat_template(
17 messages,
18 add_generation_prompt=True,
19 return_tensors="pt"
20).to(model.device)
21
22outputs = model.generate(
23 input_ids,
24 max_new_tokens=256,
25 do_sample=True,
26 temperature=0.7,
27 top_p=0.9,
28)
29
30response = tokenizer.decode(outputs[0][input_ids.shape[-1]:], skip_special_tokens=True)
31print(response)| Feature | MXFP4 | NVFP4 |
|---|---|---|
| Scale Format | E8M0 (uint8 exponent) | E4M3 + FP32 global scale |
| Group Size | 32 | 16 |
| Standard | OCP MX Specification | NVIDIA proprietary |
| Hardware | SM120+ (Blackwell) | SM89+ (Ada/Hopper/Blackwell) |