Views
No views yet
1vllm serve milwright/cloze-reader-qwen3.5-0.8b \
2 --served-model-name cloze-reader \
3 --host 127.0.0.1 --port 1234 \
4 --dtype bfloat16 --max-model-len 2048"model": "cloze-reader". To co-serve several
inference-arcade apps from one base, use the adapter repo with vLLM's --enable-lora
instead (see the adapter card).1from transformers import AutoModelForCausalLM, AutoTokenizer
2import torch
3
4REPO = "milwright/cloze-reader-qwen3.5-0.8b"
5tok = AutoTokenizer.from_pretrained(REPO)
6model = AutoModelForCausalLM.from_pretrained(REPO, torch_dtype=torch.bfloat16, device_map="auto")google/gemma-3-27b-it and
google/gemini-3.1-flash-lite-preview.