Views
No views yet
1import vllm
2
3# max_model_len/max_num_batched_tokens can be increased when running on a GPU with substantial memory.
4# NOTE: Switch to "pfnet/plamo-2-translate-base" to try the base model.
5llm = vllm.LLM(model="pfnet/plamo-2-translate", trust_remote_code=True, max_model_len=2000, max_num_batched_tokens=2000)
6
7prompt = r'''<|plamo:op|>dataset
8translation
9<|plamo:op|>input lang=English
10Write the text to be translated here.
11<|plamo:op|>output lang=Japanese
12'''
13
14responses = llm.generate([prompt] * 1, sampling_params=vllm.SamplingParams(temperature=0, max_tokens=1024, stop=["<|plamo:op|>"]))
15# NOTE: This outputs "ここに翻訳するテキストを入力してください。".
16print(responses[0].outputs[0].text)1import vllm
2
3# max_model_len/max_num_batched_tokens can be increased when running on a GPU with substantial memory.
4llm = vllm.LLM(model="pfnet/plamo-2-translate-eval", trust_remote_code=True, max_model_len=2000, max_num_batched_tokens=2000)
5
6prompt = r'''<|plamo:op|>dataset
7translation evaluation
8<|plamo:op|>input lang=English
9This is an apple.
10<|plamo:op|>output id=A lang=Japanese
11これはりんごです。
12<|plamo:op|>output id=B lang=Japanese
13これはリンゴです。
14<|plamo:op|>best
15id='''
16
17responses = llm.generate([prompt] * 1, sampling_params=vllm.SamplingParams(temperature=0, max_tokens=1, stop=["<|plamo:op|>"]))
18# NOTE: This outputs "A".
19print(responses[0].outputs[0].text)