Views
No views yet
[3, 4, 7, 10, 11, 23, 24, 25, 26, 27, 28, 29]1tokenizer = AutoTokenizer.from_pretrained(model_path)
2model = CustomMixtralForCausalLM.from_pretrained(model_path,
3 torch_dtype=torch.bfloat16,
4 low_cpu_mem_usage=True,
5 load_in_4bit=True,
6 trust_remote_code=True
7 )
8pytorch_total_params = sum(p.numel() for p in model.parameters())
9print(pytorch_total_params/1e9)
10max_length = 100
11input_text = """<|im_start|>user\nHow are you? Write a story for me please<|im_end|><|im_start|>assistant\n"""
12input_ids = tokenizer(input_text, return_tensors="pt")["input_ids"].to('cuda')
13print(len(input_ids[0]))
14output = model.generate(input_ids, max_length=max_length, temperature=0.7, repetition_penalty=1.1, do_sample=True)
15print(tokenizer.decode(output[0]))