from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained(
"SC117/Laguna-S-2.1-Uncensored",
trust_remote_code=True,
torch_dtype="bfloat16",
device_map="auto",
)
tokenizer = AutoTokenizer.from_pretrained(
"SC117/Laguna-S-2.1-Uncensored", trust_remote_code=True
)
messages = [{"role": "user", "content": "Implement a small HTTP server in Python."}]
inputs = tokenizer.apply_chat_template(
messages, add_generation_prompt=True, return_tensors="pt"
).to(model.device)
out = model.generate(**inputs, max_new_tokens=1024)
print(tokenizer.decode(out[0], skip_special_tokens=True))
vllm serve SC117/Laguna-S-2.1-Uncensored \
--tensor-parallel-size 4 \
--trust-remote-code \
--tool-call-parser poolside_v1 \
--reasoning-parser poolside_v1 \
--enable-auto-tool-choice \
--served-model-name laguna-uncensored \
--default-chat-template-kwargs '{"enable_thinking": true}'
python -m sglang.launch_server \
--model-path SC117/Laguna-S-2.1-Uncensored \
--tp-size 4 \
--trust-remote-code \
--reasoning-parser poolside_v1 \
--tool-call-parser poolside_v1