Views
No views yet
pip install hf-hub-ctranslate2>=2.0.6 ct2-transformers-converter --model togethercomputer/RedPajama-INCITE-Instruct-3B-v1 --output_dir /home/michael/tmp-ct2fast-RedPajama-INCITE-Instruct-3B-v1 --force --copy_files tokenizer.json README.md tokenizer_config.json generation_config.json special_tokens_map.json .gitattributes --quantization float16compute_type=int8_float16 for device="cuda"compute_type=int8 for device="cpu"1from hf_hub_ctranslate2 import TranslatorCT2fromHfHub, GeneratorCT2fromHfHub
2from transformers import AutoTokenizer
3
4model_name = "michaelfeil/ct2fast-RedPajama-INCITE-Instruct-3B-v1"
5# use either TranslatorCT2fromHfHub or GeneratorCT2fromHfHub here, depending on model.
6model = GeneratorCT2fromHfHub(
7 # load in int8 on CUDA
8 model_name_or_path=model_name,
9 device="cuda",
10 compute_type="int8_float16",
11 tokenizer=AutoTokenizer.from_pretrained("togethercomputer/RedPajama-INCITE-Instruct-3B-v1")
12)
13outputs = model.generate(
14 text=["How do you call a fast Flan-ingo?", "User: How are you doing? Bot:"],
15)
16print(outputs)transformers version >= 4.25.1.1import torch
2import transformers
3from transformers import AutoTokenizer, AutoModelForCausalLM
4
5MIN_TRANSFORMERS_VERSION = '4.25.1'
6
7# check transformers version
8assert transformers.__version__ >= MIN_TRANSFORMERS_VERSION, f'Please upgrade transformers to version {MIN_TRANSFORMERS_VERSION} or higher.'
9
10# init
11tokenizer = AutoTokenizer.from_pretrained("togethercomputer/RedPajama-INCITE-Instruct-3B-v1")
12model = AutoModelForCausalLM.from_pretrained("togethercomputer/RedPajama-INCITE-Instruct-3B-v1", torch_dtype=torch.float16)
13model = model.to('cuda:0')
14# infer
15prompt = "Q: The capital of France is?\nA:"
16inputs = tokenizer(prompt, return_tensors='pt').to(model.device)
17input_length = inputs.input_ids.shape[1]
18outputs = model.generate(
19 **inputs, max_new_tokens=128, do_sample=True, temperature=0.7, top_p=0.7, top_k=50, return_dict_in_generate=True
20)
21token = outputs.sequences[0, input_length:]
22output_str = tokenizer.decode(token)
23print(output_str)
24"""
25Paris
26"""1pip install accelerate
2pip install bitsandbytes1import torch
2import transformers
3from transformers import AutoTokenizer, AutoModelForCausalLM
4
5MIN_TRANSFORMERS_VERSION = '4.25.1'
6
7# check transformers version
8assert transformers.__version__ >= MIN_TRANSFORMERS_VERSION, f'Please upgrade transformers to version {MIN_TRANSFORMERS_VERSION} or higher.'
9
10# init
11tokenizer = AutoTokenizer.from_pretrained("togethercomputer/RedPajama-INCITE-Instruct-3B-v1")
12model = AutoModelForCausalLM.from_pretrained("togethercomputer/RedPajama-INCITE-Instruct-3B-v1", device_map='auto', torch_dtype=torch.float16, load_in_8bit=True)
13
14# infer
15prompt = "Q: The capital of France is?\nA:"
16inputs = tokenizer(prompt, return_tensors='pt').to(model.device)
17input_length = inputs.input_ids.shape[1]
18outputs = model.generate(
19 **inputs, max_new_tokens=128, do_sample=True, temperature=0.7, top_p=0.7, top_k=50, return_dict_in_generate=True
20)
21token = outputs.sequences[0, input_length:]
22output_str = tokenizer.decode(token)
23print(output_str)
24"""
25Paris
26"""1import torch
2import transformers
3from transformers import AutoTokenizer, AutoModelForCausalLM
4
5MIN_TRANSFORMERS_VERSION = '4.25.1'
6
7# check transformers version
8assert transformers.__version__ >= MIN_TRANSFORMERS_VERSION, f'Please upgrade transformers to version {MIN_TRANSFORMERS_VERSION} or higher.'
9
10# init
11tokenizer = AutoTokenizer.from_pretrained("togethercomputer/RedPajama-INCITE-Instruct-3B-v1")
12model = AutoModelForCausalLM.from_pretrained("togethercomputer/RedPajama-INCITE-Instruct-3B-v1", torch_dtype=torch.bfloat16)
13# infer
14prompt = "Q: The capital of France is?\nA:"
15inputs = tokenizer(prompt, return_tensors='pt').to(model.device)
16input_length = inputs.input_ids.shape[1]
17outputs = model.generate(
18 **inputs, max_new_tokens=128, do_sample=True, temperature=0.7, top_p=0.7, top_k=50, return_dict_in_generate=True
19)
20token = outputs.sequences[0, input_length:]
21output_str = tokenizer.decode(token)
22print(output_str)
23"""
24Paris
25"""LayerNormKernelImpl is not implemented in fp16 for CPU, we use bfloat16 for CPU inference.