Views
No views yet

[!NOTE] This model is an experimental release and may generate unexpected behaviors or reasoning artifacts in certain scenarios. Quantization to FP8 may introduce minor numerical differences relative to the bf16 source model.
llmcompressor with the following recipe:1default_stage:
2 default_modifiers:
3 QuantizationModifier:
4 targets: [Linear]
5 ignore: ['re:.*lm_head', 're:.*embed_tokens$', 're:.*visual.*', 're:.*model.visual.*',
6 're:.*linear_attn.*']
7 scheme: FP8_DYNAMIC
8 bypass_divisibility_checks: false
9 requires_calibration_data: falserequires_calibration_data: false). The lm_head, embedding table, any vision-tower (visual) components, and linear_attn layers are excluded from quantization and remain at full precision to preserve output-head fidelity and numerical stability.| Base model | prithivMLmods/Qwen3.5-9B-DS-v4-Flash-v3.0 |
| Quantization scheme | FP8_DYNAMIC (Linear layers only) |
| Format | compressed-tensors |
| Calibration data required | No (dynamic activation scaling) |
| Excluded from quantization | lm_head, embed_tokens, visual (if present), linear_attn |
torch >= 2.11.0vllm >= 0.19.11vllm serve prithivMLmods/Qwen3.5-9B-DS-v4-Flash-v3.0-FP8 \
2 --max-model-len 327681from openai import OpenAI
2
3client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")
4
5messages = [
6 {
7 "role": "user",
8 "content": "Explain how a transformer model processes text."
9 }
10]
11
12response = client.chat.completions.create(
13 model="prithivMLmods/Qwen3.5-9B-DS-v4-Flash-v3.0-FP8",
14 messages=messages,
15 temperature=0.0,
16 max_tokens=512,
17)
18
19print(response.choices[0].message.content)pip install transformers accelerate1from transformers import AutoTokenizer, AutoModelForCausalLM
2import torch
3
4model = AutoModelForCausalLM.from_pretrained(
5 "prithivMLmods/Qwen3.5-9B-DS-v4-Flash-v3.0-FP8",
6 torch_dtype="auto",
7 device_map="auto"
8)
9
10tokenizer = AutoTokenizer.from_pretrained(
11 "prithivMLmods/Qwen3.5-9B-DS-v4-Flash-v3.0-FP8"
12)
13
14messages = [
15 {
16 "role": "user",
17 "content": "Explain how a transformer model processes text."
18 }
19]
20
21inputs = tokenizer.apply_chat_template(
22 messages,
23 tokenize=True,
24 add_generation_prompt=True,
25 return_tensors="pt"
26).to(model.device)
27
28outputs = model.generate(
29 inputs,
30 max_new_tokens=512
31)
32
33print(
34 tokenizer.decode(
35 outputs[0][inputs.shape[-1]:],
36 skip_special_tokens=True
37 )
38)| Setting | Value |
|---|---|
| Base Model | prithivMLmods/Q3.5-9B-DS-v4-Flash-v2.0 |
| Original Backbone | Qwen/Qwen3.5-9B |
| Training Method | Multi-stage Supervised Fine-Tuning (SFT) |
| Maximum Sequence Length | 32,768 tokens (Long Context) |
| Training Precision | BF16 (Full Precision) |
| Training & Alignment Framework | TRL |
| Training Datasets | Jackrong/DeepSeek-V4-Distill-8000x, sequelbox/Titanium4-DeepSeek-V4-Pro, and additional high-quality reasoning datasets |