Views
No views yet
1import torch
2from transformers import LlamaForCausalLM, LlamaTokenizer
3
4model_name_or_path = "/your/model/path"
5tokenizer = LlamaTokenizer.from_pretrained(model_name_or_path, use_fast=False, legacy=True)
6model = LlamaForCausalLM.from_pretrained(model_name_or_path,torch_dtype=torch.float16, device_map="auto")
7inputs = tokenizer("问题:李时珍是哪一个朝代的人?回答:", return_tensors="pt").to("cuda")
8outputs = model.generate(**inputs, max_new_tokens=64, repetition_penalty=1.1)
9outputs = tokenizer.decode(outputs.cpu()[0][len(inputs.input_ids[0]):], skip_special_tokens=True)
10print(outputs)1import torch
2from transformers import LlamaForCausalLM, LlamaTokenizer
3from auto_gptq import AutoGPTQForCausalLM
4
5model_name_or_path = "/your/model/path"
6tokenizer = LlamaTokenizer.from_pretrained(model_name_or_path, use_fast=False, legacy=True)
7model = AutoGPTQForCausalLM.from_quantized(model_name_or_path,torch_dtype=torch.float16, device_map="auto")
8inputs = tokenizer("问题:李时珍是哪一个朝代的人?回答:", return_tensors="pt").to("cuda")
9outputs = model.generate(**inputs, max_new_tokens=64, repetition_penalty=1.1)
10outputs = tokenizer.decode(outputs.cpu()[0][len(inputs.input_ids[0]):], skip_special_tokens=True)
11print(outputs)1from vllm import LLM, SamplingParams
2
3sampling_params = SamplingParams(temperature=0.7, top_p=0.95,max_tokens=256)
4llm = LLM(model="/your/model/path", quantization="gptq", dtype="float16")
5
6prompts = "问题:李时珍是哪一个时代的人?回答:"
7result = llm.generate(prompts, sampling_params)
8result_output = [[output.outputs[0].text,output.outputs[0].token_ids] for output in result]
9
10print('generated_result', result_output[0])