Views
No views yet
FP8_DYNAMIC scheme.--quantization fp81pip install vllm>=0.7
2
3vllm serve toeniant/Qwen-SEA-LION-v4.5-27B-IT-FP8-Dynamic \
4 --quantization fp8 \
5 --max-model-len 2621441from vllm import LLM, SamplingParams
2
3llm = LLM(
4 model="toeniant/Qwen-SEA-LION-v4.5-27B-IT-FP8-Dynamic",
5 quantization="fp8",
6 max_model_len=262144,
7)
8
9sampling = SamplingParams(
10 temperature=0.7,
11 top_p=0.80,
12 top_k=20,
13 max_tokens=512,
14)
15
16messages = [
17 {"role": "user", "content": "Tolong carikan flat 4-bilik dekat Tampines, bajet bawah $500,000."}
18]
19
20out = llm.chat(messages, sampling_params=sampling)
21print(out[0].outputs[0].text)