Views
No views yet
1from transformers import AutoTokenizer, AutoModelForCausalLM
2import torch
3tokenizer = AutoTokenizer.from_pretrained("THUDM/LongWriter-llama3.1-8b", trust_remote_code=True)
4model = AutoModelForCausalLM.from_pretrained("THUDM/LongWriter-llama3.1-8b", torch_dtype=torch.bfloat16, trust_remote_code=True, device_map="auto")
5model = model.eval()
6query = "Write a 10000-word China travel guide"
7prompt = f"[INST]{query}[/INST]"
8input = tokenizer(prompt, truncation=False, return_tensors="pt").to(device)
9context_length = input.input_ids.shape[-1]
10output = model.generate(
11 **input,
12 max_new_tokens=32768,
13 num_beams=1,
14 do_sample=True,
15 temperature=0.5,
16)[0]
17response = tokenizer.decode(output[context_length:], skip_special_tokens=True)
18print(response)