Views
No views yet
1[model]
2model_name_or_path = "yandex/YandexGPT-5-Lite-8B-pretrain"
3
4[datasets]
5dataset = "attn-signs/gromov-0"
6conversation_field = "conversation"
7generate_eval_examples = false
8evaluation_strategy = "steps"
9eval_steps = 100
10dataloader_num_workers = 2
11remove_unused_columns = true
12test_size = 0.05
13
14[run]
15save_strategy = "steps"
16save_steps = 300
17save_total_limit = 3
18run_name = "sft-gptr-8-run2"
19report_to = "wandb"
20logging_first_step = true
21logging_steps = 1
22output_dir = "models/attn-signs-gptr-8-run2"
23project_name = "sft-gptr"
24
25[training]
26train_only_on_completions = true
27per_device_train_batch_size = 1
28per_device_eval_batch_size = 1
29num_train_epochs = 3
30learning_rate = 0.000009
31max_seq_length = 8192
32gradient_accumulation_steps = 8
33gradient_checkpointing = true
34warmup_steps = 10
35bf16 = true
36seed = 42
37use_peft = false
38
39[fusion]
40attn_implementation = "flash_attention_2"
41
42[tokenizer]
43assistant_message_template = "<s>assistant\n"
44eos_token = "</s>"
45pad_token = "<unk>"
46chat_template = "{% if not add_generation_prompt is defined %}{% set add_generation_prompt = false %}{% endif %}{% for message in messages %}{{'<s>' + message['role'] + '\n' + message['content'] + '</s>' + '\n'}}{% endfor %}{% if add_generation_prompt %}{{ '<s>assistant\n' }}{% endif %}"
47force_chat_template = true
48added_special_tokens = [
49 "<think>",
50 "</think>"
51]
52system_prompt = """
53[MODE: Reflection]
54"""1repo = 'attn-signs/GPTR-8-base'
2
3model = AutoModelForCausalLM.from_pretrained(repo)
4tokenizer = AutoTokenizer.from_pretrained(repo)
5
6device = 'cuda' if torch.cuda.is_available() else 'cpu'
7model.to(device)
8
9user_prompt = '''
10У уравнений x**2 + 2019ax + b = 0 и x**2 + 2019bx + a = 0 есть один общий корень. Чему может быть равен этот корень, если известно, что a != b?
11'''
12system_prompt = "[MODE: Reflection]"
13messages = [
14 {"role": "system", "content": system_prompt},
15 {"role": "user", "content": user_prompt}
16]
17text = tokenizer.apply_chat_template(
18 messages,
19 tokenize=False,
20 add_generation_prompt=True
21)
22model_inputs = tokenizer([text], return_tensors="pt").to(model.device)
23
24generated_ids = model.generate(
25 **model_inputs,
26 max_new_tokens=4096
27)
28generated_ids = [
29 output_ids[len(input_ids):] for input_ids, output_ids in zip(model_inputs.input_ids, generated_ids)
30]
31
32response = tokenizer.batch_decode(generated_ids, skip_special_tokens=True)[0]
33
34print(response)