Views
No views yet
transformers version >= 4.25.1.1import torch
2import transformers
3from transformers import AutoTokenizer, AutoModelForCausalLM
4
5MIN_TRANSFORMERS_VERSION = '4.25.1'
6
7# check transformers version
8assert transformers.__version__ >= MIN_TRANSFORMERS_VERSION, f'Please upgrade transformers to version {MIN_TRANSFORMERS_VERSION} or higher.'
9
10# init
11tokenizer = AutoTokenizer.from_pretrained("togethercomputer/RedPajama-INCITE-Instruct-3B-v1")
12model = AutoModelForCausalLM.from_pretrained("togethercomputer/RedPajama-INCITE-Instruct-3B-v1", torch_dtype=torch.float16)
13model = model.to('cuda:0')
14# infer
15prompt = "Q: The capital of France is?\nA:"
16inputs = tokenizer(prompt, return_tensors='pt').to(model.device)
17input_length = inputs.input_ids.shape[1]
18outputs = model.generate(
19 **inputs, max_new_tokens=128, do_sample=True, temperature=0.7, top_p=0.7, top_k=50, return_dict_in_generate=True
20)
21token = outputs.sequences[0, input_length:]
22output_str = tokenizer.decode(token)
23print(output_str)
24"""
25Paris
26"""1pip install accelerate
2pip install bitsandbytes1import torch
2import transformers
3from transformers import AutoTokenizer, AutoModelForCausalLM
4
5MIN_TRANSFORMERS_VERSION = '4.25.1'
6
7# check transformers version
8assert transformers.__version__ >= MIN_TRANSFORMERS_VERSION, f'Please upgrade transformers to version {MIN_TRANSFORMERS_VERSION} or higher.'
9
10# init
11tokenizer = AutoTokenizer.from_pretrained("togethercomputer/RedPajama-INCITE-Instruct-3B-v1")
12model = AutoModelForCausalLM.from_pretrained("togethercomputer/RedPajama-INCITE-Instruct-3B-v1", device_map='auto', torch_dtype=torch.float16, load_in_8bit=True)
13
14# infer
15prompt = "Q: The capital of France is?\nA:"
16inputs = tokenizer(prompt, return_tensors='pt').to(model.device)
17input_length = inputs.input_ids.shape[1]
18outputs = model.generate(
19 **inputs, max_new_tokens=128, do_sample=True, temperature=0.7, top_p=0.7, top_k=50, return_dict_in_generate=True
20)
21token = outputs.sequences[0, input_length:]
22output_str = tokenizer.decode(token)
23print(output_str)
24"""
25Paris
26"""1import torch
2import transformers
3from transformers import AutoTokenizer, AutoModelForCausalLM
4
5MIN_TRANSFORMERS_VERSION = '4.25.1'
6
7# check transformers version
8assert transformers.__version__ >= MIN_TRANSFORMERS_VERSION, f'Please upgrade transformers to version {MIN_TRANSFORMERS_VERSION} or higher.'
9
10# init
11tokenizer = AutoTokenizer.from_pretrained("togethercomputer/RedPajama-INCITE-Instruct-3B-v1")
12model = AutoModelForCausalLM.from_pretrained("togethercomputer/RedPajama-INCITE-Instruct-3B-v1", torch_dtype=torch.bfloat16)
13# infer
14prompt = "Q: The capital of France is?\nA:"
15inputs = tokenizer(prompt, return_tensors='pt').to(model.device)
16input_length = inputs.input_ids.shape[1]
17outputs = model.generate(
18 **inputs, max_new_tokens=128, do_sample=True, temperature=0.7, top_p=0.7, top_k=50, return_dict_in_generate=True
19)
20token = outputs.sequences[0, input_length:]
21output_str = tokenizer.decode(token)
22print(output_str)
23"""
24Paris
25"""LayerNormKernelImpl is not implemented in fp16 for CPU, we use bfloat16 for CPU inference.