Views
No views yet

1from vllm import LLM, SamplingParams
2from transformers import AutoTokenizer
3
4model_id = "speakleash/Bielik-11B-v2.1-Instruct-FP8"
5
6sampling_params = SamplingParams(temperature=0.2, top_p=0.95, max_tokens=4096)
7
8tokenizer = AutoTokenizer.from_pretrained(model_id)
9
10messages = [
11 {"role": "system", "content": "Jesteś pomocnym asystentem Bielik."},
12 {"role": "user", "content": "Kim był Mikołaj Kopernik i z czego zasłynął?"},
13]
14
15prompts = tokenizer.apply_chat_template(messages, tokenize=False)
16
17llm = LLM(model=model_id, max_model_len=4096)
18
19outputs = llm.generate(prompts, sampling_params)
20
21generated_text = outputs[0].outputs[0].text
22print(generated_text)python -m sglang.launch_server --model-path speakleash/Bielik-11B-v2.1-Instruct-FP8 --port 300001import openai
2client = openai.Client(
3 base_url="http://127.0.0.1:30000/v1", api_key="EMPTY")
4
5response = client.chat.completions.create(
6 model="default",
7 messages=[
8 {"role": "system", "content": "Jesteś pomocnym asystentem Bielik."},
9 {"role": "user", "content": "Kim był Mikołaj Kopernik i z czego zasłynął?"},
10 ],
11 temperature=0,
12 max_tokens=4096,
13)
14print(response)
15