Views
No views yet
1python -m vllm.entrypoints.openai.api_server \
2 --model macadeliccc/Samantha-Qwen2-7B-AWQ \
3 --chat-template ./examples/template_chatml.jinja \
4 --quantization awq1from openai import OpenAI
2# Set OpenAI's API key and API base to use vLLM's API server.
3openai_api_key = "EMPTY"
4openai_api_base = "http://localhost:8000/v1"
5
6client = OpenAI(
7 api_key=openai_api_key,
8 base_url=openai_api_base,
9)
10
11chat_response = client.chat.completions.create(
12 model="macadeliccc/Samantha-Qwen2-7B-AWQ",
13 messages=[
14 {"role": "system", "content": "You are a helpful assistant."},
15 {"role": "user", "content": "Tell me a joke."},
16 ]
17)
18print("Chat response:", chat_response)<|im_start|>system
You are a friendly assistant.<|im_end|>
<|im_start|>user
What is the capital of France?<|im_end|>
<|im_start|>assistant
The capital of France is Paris.0.4.01base_model: Qwen/Qwen-7B
2model_type: AutoModelForCausalLM
3tokenizer_type: AutoTokenizer
4
5trust_remote_code: true
6
7load_in_8bit: false
8load_in_4bit: true
9strict: false
10
11datasets:
12 - path: macadeliccc/opus_samantha
13 type: sharegpt
14 field: conversations
15 conversation: chatml
16 - path: uncensored-ultrachat.json
17 type: sharegpt
18 field: conversations
19 conversation: chatml
20 - path: openhermes_200k.json
21 type: sharegpt
22 field: conversations
23 conversation: chatml
24 - path: opus_instruct.json
25 type: sharegpt
26 field: conversations
27 conversation: chatml
28
29chat_template: chatml
30dataset_prepared_path:
31val_set_size: 0.05
32output_dir: ./outputs/lora-out
33
34sequence_len: 2048
35sample_packing: false
36pad_to_sequence_len:
37
38adapter: qlora
39lora_model_dir:
40lora_r: 32
41lora_alpha: 16
42lora_dropout: 0.05
43lora_target_linear: true
44lora_fan_in_fan_out:
45
46wandb_project:
47wandb_entity:
48wandb_watch:
49wandb_name:
50wandb_log_model:
51
52gradient_accumulation_steps: 4
53micro_batch_size: 2
54num_epochs: 1
55optimizer: adamw_bnb_8bit
56lr_scheduler: cosine
57learning_rate: 0.0002
58
59train_on_inputs: false
60group_by_length: false
61bf16: auto
62fp16:
63tf32: false
64
65gradient_checkpointing: false
66early_stopping_patience:
67resume_from_checkpoint:
68local_rank:
69logging_steps: 1
70xformers_attention:
71flash_attention:
72
73warmup_steps: 250
74evals_per_epoch: 4
75eval_table_size:
76eval_max_new_tokens: 128
77saves_per_epoch: 1
78debug:
79deepspeed:
80weight_decay: 0.0
81fsdp:
82fsdp_config:
83special_tokens: