Views
No views yet
1pip install "vllm>=0.21"
2vllm serve ai9stars/G9v3-39A5B --port 80001curl http://localhost:8000/v1/chat/completions \
2 -H "Content-Type: application/json" \
3 -d '{
4 "model": "ai9stars/G9v3-39A5B",
5 "messages": [{"role": "user", "content": "Who are you?"}],
6 "max_tokens": 128,
7 "temperature": 0.7
8 }'1pip install "sglang[srt]>=0.5.12"
2python -m sglang.launch_server --model-path ai9stars/G9v3-39A5B --port 300001curl http://localhost:30000/v1/chat/completions \
2 -H "Content-Type: application/json" \
3 -d '{
4 "model": "ai9stars/G9v3-39A5B",
5 "messages": [{"role": "user", "content": "Who are you?"}],
6 "max_tokens": 128,
7 "temperature": 0.7
8 }'pip install -U "transformers>=5.6" accelerate torch1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model_id = "ai9stars/G9v3-39A5B"
4tokenizer = AutoTokenizer.from_pretrained(model_id)
5model = AutoModelForCausalLM.from_pretrained(
6 model_id,
7 torch_dtype="auto",
8 device_map="auto",
9)
10
11messages = [{"role": "user", "content": "Who are you?"}]
12inputs = tokenizer.apply_chat_template(
13 messages,
14 tokenize=True,
15 add_generation_prompt=True,
16 enable_thinking=False,
17 return_dict=True,
18 return_tensors="pt",
19).to(model.device)
20
21outputs = model.generate(**inputs, max_new_tokens=128)
22print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:], skip_special_tokens=True))| Mode | Recommended params | Enable |
|---|---|---|
| Think | temperature=1.0, top_p=0.95 | enable_thinking=True |
| No Think | temperature=0.7, top_p=0.95 | enable_thinking=False |