Views
No views yet
meta-llama/Llama-2-13b
└── inceptionai/jais-adapted-13b-chat
└── JAIS-Adapted-13B-Chat-8bit-Simple (this model)| Specification | Value |
|---|---|
| Model Size | 25GB |
| Precision | bfloat16 |
| Context Length | 1024 tokens |
| GPU Memory | 24.9 GiB |
| Loading Time | 5.5 seconds |
| Architecture | Transformer (LLaMA-based) |
| Vocabulary Size | 65,024 tokens |
1vllm serve /home/sagemaker-user/quantized_models/jais-adapted-13b-chat-8bit-simple \
2 --gpu-memory-utilization 0.7 \
3 --trust-remote-code \
4 --dtype bfloat16 \
5 --max-model-len 1024 \
6 --host 0.0.0.0 \
7 --port 80001vllm serve /home/sagemaker-user/quantized_models/jais-adapted-13b-chat-8bit-simple \
2 --gpu-memory-utilization 0.7 \
3 --trust-remote-code \
4 --dtype bfloat16 \
5 --max-model-len 1024 \
6 --tensor-parallel-size $(nvidia-smi --list-gpus | wc -l) \
7 --host 0.0.0.0 \
8 --port 80001curl -X POST "http://localhost:8000/v1/completions" \
2 -H "Content-Type: application/json" \
3 -d '{
4 "model": "/home/sagemaker-user/quantized_models/jais-adapted-13b-chat-8bit-simple",
5 "prompt": "What is artificial intelligence and how does it work?",
6 "max_tokens": 150,
7 "temperature": 0.7,
8 "top_p": 0.9
9 }'1curl -X POST "http://localhost:8000/v1/completions" \
2 -H "Content-Type: application/json" \
3 -d '{
4 "model": "/home/sagemaker-user/quantized_models/jais-adapted-13b-chat-8bit-simple",
5 "prompt": "ما هو الذكاء الاصطناعي وكيف يعمل؟",
6 "max_tokens": 150,
7 "temperature": 0.7,
8 "top_p": 0.9
9 }'1curl -X POST "http://localhost:8000/v1/completions" \
2 -H "Content-Type: application/json" \
3 -d '{
4 "model": "/home/sagemaker-user/quantized_models/jais-adapted-13b-chat-8bit-simple",
5 "prompt": "<|im_start|>system\nYou are JAIS, a helpful AI assistant.\n<|im_end|>\n<|im_start|>user\nExplain machine learning in simple terms\n<|im_end|>\n<|im_start|>assistant\n",
6 "max_tokens": 200,
7 "temperature": 0.7
8 }'1vllm bench serve \
2 --backend openai \
3 --base-url http://127.0.0.1:8000 \
4 --model "/home/sagemaker-user/quantized_models/jais-adapted-13b-chat-8bit-simple" \
5 --dataset-name random \
6 --random-input-len 256 \
7 --random-output-len 768 \
8 --num-prompts 1001vllm bench throughput \
2 --model "/home/sagemaker-user/quantized_models/jais-adapted-13b-chat-8bit-simple" \
3 --dtype bfloat16 \
4 --input-len 512 \
5 --output-len 256 \
6 --num-prompts 501vllm bench latency \
2 --model "/home/sagemaker-user/quantized_models/jais-adapted-13b-chat-8bit-simple" \
3 --dtype bfloat16 \
4 --input-len 256 \
5 --output-len 128 \
6 --num-prompts 201from vllm import LLM, SamplingParams
2
3# Initialize model
4llm = LLM(
5 model="/home/sagemaker-user/quantized_models/jais-adapted-13b-chat-8bit-simple",
6 gpu_memory_utilization=0.7,
7 trust_remote_code=True,
8 max_model_len=1024,
9 dtype="bfloat16"
10)
11
12# Generate response
13sampling_params = SamplingParams(temperature=0.7, top_p=0.9, max_tokens=100)
14outputs = llm.generate(["What is machine learning?"], sampling_params)
15print(outputs[0].outputs[0].text)1prompts = [
2 "Explain artificial intelligence",
3 "ما هو الذكاء الاصطناعي؟",
4 "Write a short poem about technology",
5 "اكتب قصيدة قصيرة عن التكنولوجيا"
6]
7
8outputs = llm.generate(prompts, sampling_params)
9for i, output in enumerate(outputs):
10 print(f"Prompt {i+1}: {output.outputs[0].text}")curl http://localhost:8000/healthcurl http://localhost:8000/v1/models1# Real-time GPU usage
2nvidia-smi -l 1
3
4# Memory monitoring
5watch -n 1 'nvidia-smi --query-gpu=memory.used,memory.total,utilization.gpu --format=csv'1# Server metrics
2curl http://localhost:8000/metrics
3
4# Custom monitoring script
5python -c "
6import requests
7import time
8start = time.time()
9response = requests.post('http://localhost:8000/v1/completions',
10 json={'model': '/home/sagemaker-user/quantized_models/jais-adapted-13b-chat-8bit-simple',
11 'prompt': 'Test prompt', 'max_tokens': 50})
12print(f'Response time: {time.time() - start:.2f}s')
13print(f'Status: {response.status_code}')
14"Prompt: "What is artificial intelligence?"<|im_start|>system
You are JAIS, a helpful AI assistant fluent in Arabic and English.
<|im_end|>
<|im_start|>user
{user_message}
<|im_end|>
<|im_start|>assistantEnglish: "Explain machine learning"
Arabic: "اشرح التعلم الآلي"
Mixed: "Explain machine learning in both English and Arabic"1@misc{jais-8bit-quantized,
2 title={JAIS-Adapted-13B-Chat-8bit-Simple},
3 author={Quantized from inceptionai/jais-adapted-13b-chat},
4 year={2024},
5 note={8-bit quantized version optimized for vLLM inference}
6}