Views
No views yet
1vllm serve Flashtond22/Taltos-27B-FP8 \
2 --served-model-name taltos \
3 --max-model-len 32768 \
4 --reasoning-parser qwen31from openai import OpenAI
2client = OpenAI(base_url="http://localhost:8000/v1", api_key="-")
3
4válasz = client.chat.completions.create(
5 model="taltos",
6 messages=[{"role": "user", "content": "Írj egy udvarias felmondólevelet."}],
7)
8print(válasz.choices[0].message.content)| Változat | Méret | VRAM | Ajánlott hardver |
|---|---|---|---|
| bf16 | 56 GB | ~58 GB | H100, 2 × A100 |
| FP8 (ez) | 30 GB | ~32 GB | L40S, A6000, A100 40 GB |
| GGUF | 10 GB-tól | 12 GB-tól | Ollama, llama.cpp, CPU |