Views
No views yet
1from vllm import LLM
2
3llm = LLM(
4 model="Qwen/Qwen3-14B",
5 speculative_model="your-username/qwen3-14b-speculator",
6 num_speculative_tokens=3,
7 trust_remote_code=True
8)
9
10outputs = llm.generate("Hello, how are you?", max_tokens=100)
11print(outputs[0].outputs[0].text)