Views
No views yet
1beta: 10
2gamma_beta_ratio: 1
3learning_rate: 8.0e-7
4log_level: info
5logging_steps: 5
6max_length: 2048
7max_prompt_length: 1800
8num_train_epochs: 1
9batch_size: 1281<bos><start_of_turn>user
2How are you?<end_of_turn>
3<start_of_turn>model
4Hi!<end_of_turn>1from transformers import AutoModelForCausalLM, AutoTokenizer, LogitsProcessorList
2import torch
3device = "cuda" # the device to load the model onto
4
5model = AutoModelForCausalLM.from_pretrained("BAAI/Gemma2-9B-IT-Simpo-Infinity-Preference",
6 torch_dtype=torch.bfloat16,
7 device_map="auto"
8)
9tokenizer = AutoTokenizer.from_pretrained("BAAI/Gemma2-9B-IT-Simpo-Infinity-Preference")
10
11prompt = "Give me a short introduction to large language model."
12messages = [
13 {"role": "user", "content": prompt}
14]
15
16text = tokenizer.apply_chat_template(
17 messages,
18 tokenize=False,
19 add_generation_prompt=True
20)
21model_inputs = tokenizer([text], return_tensors="pt").to(device)
22
23logits_processor = LogitsProcessorList(
24 [
25 MinLengthLogitsProcessor(1, eos_token_id=tokenizer.eos_token_id),
26 TemperatureLogitsWarper(0.8),
27 ]
28 )
29
30generated_ids = model.generate(
31 model_inputs.input_ids,
32 logits_processor=logits_processor,
33 max_new_tokens=512
34)
35
36generated_ids = [
37 output_ids[len(input_ids):] for input_ids, output_ids in zip(model_inputs.input_ids, generated_ids)
38]
39
40response = tokenizer.batch_decode(generated_ids, skip_special_tokens=True)[0]
41print(response)