Views
No views yet
1from transformers import AutoModelForCausalLM, AutoTokenizer, TextStreamer
2
3tokenizer = AutoTokenizer.from_pretrained("kishizaki-sci/Llama-3.3-70B-Instruct-AWQ-4bit-JP-EN")
4model = AutoModelForCausalLM.from_pretrained("kishizaki-sci/Llama-3.3-70B-Instruct-AWQ-4bit-JP-EN")
5model.to("cuda")
6
7chat = [
8 {"role": "system", "content": "あなたは日本語で応答するAIチャットボットです。ユーザをサポートしてください。"},
9 {"role": "user", "content": "plotly.graph_objectsを使って散布図を作るサンプルコードを書いてください。"}
10]
11prompt = tokenizer.apply_chat_template(
12 chat,
13 tokenize=False,
14 add_generation_prompt=True
15)
16inputs = tokenizer(prompt, return_tensors="pt")
17inputs = inputs.to("cuda")
18streamer = TextStreamer(tokenizer)
19
20output = model.generate(**inputs, streamer=streamer, max_new_tokens=1024)1from vllm import LLM, SamplingParams
2
3llm = LLM(
4 model="kishizaki-sci/Llama-3.3-70B-Instruct-AWQ-4bit-JP-EN",
5 tensor_parallel_size=1,
6 gpu_memory_utilization=0.97,
7 quantization="awq"
8)
9tokenizer = llm.get_tokenizer()
10
11messages = [
12 {"role": "system", "content": "あなたは日本語で応答するAIチャットボットです。ユーザをサポートしてください。"},
13 {"role": "user", "content": "plotly.graph_objectsを使って散布図を作るサンプルコードを書いてください。"},
14]
15
16prompt = tokenizer.apply_chat_template(
17 messages,
18 tokenize=False,
19 add_generation_prompt=True
20)
21
22sampling_params = SamplingParams(
23 temperature=0.6,
24 top_p=0.9,
25 max_tokens=1024
26)
27
28outputs = llm.generate(prompt, sampling_params)
29print(outputs[0].outputs[0].text)