Views
No views yet
transforemrs>=4.43.0).1from transformers import AutoTokenizer, AutoModelForCausalLM
2import torch
3tokenizer = AutoTokenizer.from_pretrained("THUDM/LongWriter-glm4-9b", trust_remote_code=True)
4model = AutoModelForCausalLM.from_pretrained("THUDM/LongWriter-glm4-9b", torch_dtype=torch.bfloat16, trust_remote_code=True, device_map="auto")
5model = model.eval()
6query = "Write a 10000-word China travel guide"
7response, history = model.chat(tokenizer, query, history=[], max_new_tokens=32768, temperature=0.5)
8print(response)1from vllm import LLM, SamplingParams
2model = LLM(
3 model= "THUDM/LongWriter-glm4-9b",
4 dtype="auto",
5 trust_remote_code=True,
6 tensor_parallel_size=1,
7 max_model_len=32768,
8 gpu_memory_utilization=1,
9)
10tokenizer = model.get_tokenizer()
11stop_token_ids = [tokenizer.eos_token_id, tokenizer.get_command("<|user|>"), tokenizer.get_command("<|observation|>")]
12generation_params = SamplingParams(
13 temperature=0.5,
14 top_p=0.8,
15 top_k=50,
16 max_tokens=32768,
17 repetition_penalty=1,
18 stop_token_ids=stop_token_ids
19)
20query = "Write a 10000-word China travel guide"
21input_ids = tokenizer.build_chat_input(query, history=[], role='user').input_ids[0].tolist()
22outputs = model.generate(
23 sampling_params=generation_params,
24 prompt_token_ids=[input_ids],
25)
26output = outputs[0]
27print(output.outputs[0].text)