Views
No views yet

Qwen2ForCausalLM in vLLM, inference on text longer than 32K requires using native transformers implementations.1import io
2import requests
3from PyPDF2 import PdfReader
4from vllm import LLM, SamplingParams
5llm = LLM(model="wenbopan/Faro-Qwen-1.8B")
6pdf_data = io.BytesIO(requests.get("https://arxiv.org/pdf/2303.08774.pdf").content)
7document = "".join(page.extract_text() for page in PdfReader(pdf_data).pages) # 100 pages
8question = f"{document}\n\nAccording to the paper, what is the parameter count of GPT-4?"
9messages = [ {"role": "user", "content": question} ] # 83K tokens
10prompt = llm.get_tokenizer().apply_chat_template(messages, add_generation_prompt=True, tokenize=False)
11output = llm.generate(prompt, SamplingParams(temperature=0.8, max_tokens=500))
12print(output[0].outputs[0].text)1from transformers import AutoModelForCausalLM, AutoTokenizer
2model = AutoModelForCausalLM.from_pretrained('wenbopan/Faro-Qwen-1.8B', device_map="cuda")
3tokenizer = AutoTokenizer.from_pretrained('wenbopan/Faro-Qwen-1.8B')
4messages = [
5 {"role": "system", "content": "You are a helpful assistant. Always answer with a short response."},
6 {"role": "user", "content": "Tell me what is Pythagorean theorem like you are a pirate."}
7]
8input_ids = tokenizer.apply_chat_template(messages, tokenize=True, add_generation_prompt=True, return_tensors="pt").to(model.device)
9generated_ids = model.generate(input_ids, max_new_tokens=512, temperature=0.5)
10response = tokenizer.decode(generated_ids[0], skip_special_tokens=True)