Views
No views yet
vllm serve Imran1/Llama-3.1-Tulu-3-70B-Fp8 --api-key token-abc123 --tensor-parallel-size 21from openai import OpenAI
2
3client = OpenAI(
4 base_url="http://localhost:8000/v1", # Your vLLM server URL
5 api_key="token-abc123", # Replace with your API key
6)
7
8# Example chat completion request
9completion = client.chat.completions.create(
10 model="Imran1/Llama-3.1-Tulu-3-70B-Fp8",
11 messages=[
12 {"role": "user", "content": "Hello!"},
13 ],
14 max_tokens=500,
15 stream=True
16)
17
18print(completion)