Views
No views yet
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained("ping98k/open-llama-7b-openthought-sft-4bit", device_map="auto")
4tokenizer = AutoTokenizer.from_pretrained("ping98k/open-llama-7b-openthought-sft-4bit")
5
6messages = [
7 {"role": "system", "content": "You are a helpful assistant."},
8 {"role": "user", "content": "What is a linked list?"},
9]
10prompt = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True, enable_thinking=True)
11inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
12output = model.generate(**inputs, max_new_tokens=512, temperature=0.7, do_sample=True)
13print(tokenizer.decode(output[0], skip_special_tokens=False))