1from vllm import LLM, SamplingParams
2
3# Multi-GPU setup (recommended for production)
4llm = LLM(
5 "TevunahAi/Llama-3.1-70B-Instruct-Ultra-Hybrid",
6 tensor_parallel_size=2,
7 gpu_memory_utilization=0.90,
8)
9
10# Single GPU with CPU offload (24GB+ VRAM)
11# llm = LLM(
12# "TevunahAi/Llama-3.1-70B-Instruct-Ultra-Hybrid",
13# cpu_offload_gb=10,
14# max_model_len=8192,
15# gpu_memory_utilization=0.90,
16# )
17
18sampling_params = SamplingParams(temperature=0.7, top_p=0.9, max_tokens=256)
19outputs = llm.generate(["Explain quantum computing:"], sampling_params)
20print(outputs[0].outputs[0].text)
Unlike consumer-grade quantizations that use 256 calibration samples, TevunahAi uses 2,048 diverse samples (8x industry baseline) to ensure:
This model inherits the Llama 3.1 Community License from Meta.
1@model{tevunahai2024llama31-70b-ultra-hybrid,
2 title={Llama-3.1-70B-Instruct-Ultra-Hybrid},
3 author={TevunahAi},
4 year={2024},
5 publisher={HuggingFace},
6 url={https://huggingface.co/TevunahAi/Llama-3.1-70B-Instruct-Ultra-Hybrid}
7}