Views
No views yet

1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3
4MODEL_NAME = "yandex/YandexGPT-5-Lite-8B-instruct"
5
6tokenizer = AutoTokenizer.from_pretrained(MODEL_NAME)
7model = AutoModelForCausalLM.from_pretrained(
8 MODEL_NAME,
9 device_map="cuda",
10 torch_dtype="auto",
11)
12
13messages = [{"role": "user", "content": "Для чего нужна токенизация?"}]
14input_ids = tokenizer.apply_chat_template(
15 messages, tokenize=True, return_tensors="pt"
16).to("cuda")
17
18outputs = model.generate(input_ids, max_new_tokens=1024)
19print(tokenizer.decode(outputs[0][input_ids.size(1) :], skip_special_tokens=True))1from vllm import LLM, SamplingParams
2from transformers import AutoTokenizer
3
4
5MODEL_NAME = "yandex/YandexGPT-5-Lite-8B-instruct"
6
7sampling_params = SamplingParams(
8 temperature=0.3,
9 top_p=0.9,
10 max_tokens=1024,
11)
12
13tokenizer = AutoTokenizer.from_pretrained(MODEL_NAME)
14llm = LLM(
15 MODEL_NAME,
16 tensor_parallel_size=1,
17)
18
19messages = [{"role": "user", "content": "В чем смысл жизни?"}]
20input_ids = tokenizer.apply_chat_template(
21 messages, tokenize=True, add_generation_prompt=True
22)[1:] # remove bos
23text = tokenizer.decode(input_ids)
24
25outputs = llm.generate(text, use_tqdm=False, sampling_params=sampling_params)
26
27print(tokenizer.decode(outputs[0].outputs[0].token_ids, skip_special_tokens=True))
28original_tokenizer. В нашей инфраструктуре каждую реплику диалога мы токенизируем отдельно.\n токены мы заменяем на [NL], это можно сделать с помощью text.replace("\n", "[NL]") перед токенизацией.Ассистент:[SEP], завершая её токеном </s>. При этом диалог в промпте может быть любой длины.