Views
No views yet
| Property | Value |
|---|---|
| Base Model | Qwen/Qwen3.8-27B |
| Quantization | FP8 Dynamic (W8A8) |
| Format | Safetensors (2 shards) |
| Total Size | ~27 GB |
| VRAM Reduction | ~50% vs BF16 |
| Quality Loss | Minimal |
1vllm serve douyamv/Qwen3.8-27B-FP8 \
2 --tensor-parallel-size 1 \
3 --max-model-len 32768 \
4 --trust-remote-code1python -m sglang.launch_server \
2 --model-path douyamv/Qwen3.8-27B-FP8 \
3 --tp 1 \
4 --trust-remote-code1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained(
4 "douyamv/Qwen3.8-27B-FP8",
5 device_map="auto",
6 trust_remote_code=True,
7)
8tokenizer = AutoTokenizer.from_pretrained("douyamv/Qwen3.8-27B-FP8")
9
10messages = [{"role": "user", "content": "Hello, tell me about yourself"}]
11text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
12inputs = tokenizer([text], return_tensors="pt").to(model.device)
13outputs = model.generate(**inputs, max_new_tokens=512)
14print(tokenizer.decode(outputs[0], skip_special_tokens=True))