Views
No views yet
1from vllm import LLM, SamplingParams
2llm = LLM(
3 model="kishizaki-sci/Llama-3.1-405B-Instruct-AWQ-4bit-JP-EN",
4 tensor_parallel_size=4,
5 gpu_memory_utilization=0.97,
6 quantization="awq"
7)
8tokenizer = llm.get_tokenizer()
9messages = [
10 {"role": "system", "content": "あなたは日本語で応答するAIチャットボットです。ユーザをサポートしてください。"},
11 {"role": "user", "content": "plotly.graph_objectsを使って散布図を作るサンプルコードを書いてください。"},
12]
13prompt = tokenizer.apply_chat_template(
14 messages,
15 tokenize=False,
16 add_generation_prompt=True
17)
18sampling_params = SamplingParams(
19 temperature=0.6,
20 top_p=0.9,
21 max_tokens=1024
22)
23outputs = llm.generate(prompt, sampling_params)
24print(outputs[0].outputs[0].text)