Views
No views yet
python -m vllm.entrypoints.openai.api_server --model Respair/Japanese_Phoneme_to_Grapheme_LLM--port 80001
2# pip install vllm
3
4from openai import OpenAI
5
6
7openai_api_key = "EMPTY"
8openai_api_base = "http://localhost:8000/v1"
9
10client = OpenAI(
11 api_key=openai_api_key,
12 base_url=openai_api_base,
13)
14
15model_name = "Respair/Japanese_Phoneme_to_Grapheme_LLM"
16
17
18def p2g(param):
19
20 chat_response = client.chat.completions.create(
21
22 model=model_name,
23 max_tokens=512,
24 temperature=0.01,
25
26 messages=[
27
28 {"role": "user", "content": f"{prompt}"}]
29 )
30
31 return chat_response.choices[0].message.content
32
33
34prompt= f"""convert this pronunciation back to normal japanese: geɴ'iɴ? sonna fɯɯ ni ɕiɽoi hebi no geŋkakɯ ga, omae no ɕɯɯi ni naɴ do mo naɴ do mo aɽawaɽerɯ, kiʔkake na no ka naɴ na no ka? mi ni oboeʔtsɯ no ka? """
35
36result= p2g(prompt)
37
38print(result)1from transformers import AutoModelForCausalLM, AutoTokenizer
2device = "cuda" # the device to load the model onto
3
4model = AutoModelForCausalLM.from_pretrained(
5 "Respair/Japanese_Phoneme_to_Grapheme_LLM",
6 torch_dtype="auto",
7 device_map="auto"
8)
9tokenizer = AutoTokenizer.from_pretrained("Respair/Japanese_Phoneme_to_Grapheme_LLM")
10
11
12tokenizer.pad_token = "<|endoftext|>"
13tokenizer.bos_token = "<|endoftext|>"
14tokenizer.eos_token = "<|im_end|>"
15prompt = "convert this pronunciation back to normal japanese: geɴ'iɴ? sonna fɯɯ ni ɕiɽoi hebi no geŋkakɯ ga, omae no ɕɯɯi ni naɴ do mo naɴ do mo aɽawaɽerɯ, kiʔkake na no ka naɴ na no ka? mi ni oboeʔtsɯ no ka?"
16# or anyother prompts, this model was trained on an instruction tuned dataset, so it should be a bit robust to variations in prompt
17
18
19messages = [
20
21 {"role": "user", "content": prompt}
22]
23text = tokenizer.apply_chat_template(
24 messages,
25 tokenize=False,
26 add_generation_prompt=True
27)
28model_inputs = tokenizer([text], return_tensors="pt").to(device)
29
30generated_ids = model.generate(
31 model_inputs.input_ids,
32
33 pad_token_id=tokenizer.pad_token_id,
34 bos_token_id=tokenizer.bos_token_id,
35 eos_token_id=tokenizer.eos_token_id,
36
37 temperature=0.1,
38 max_new_tokens=512
39)
40generated_ids = [
41 output_ids[len(input_ids):] for input_ids, output_ids in zip(model_inputs.input_ids, generated_ids)
42]
43
44response = tokenizer.batch_decode(generated_ids, skip_special_tokens=True)[0]
45response