Views
No views yet
| Chips | ttft | w4a16 |
|---|---|---|
| AX650 | 1514.3 ms (1k prefill) | 15.7 tokens/sec |
1git clone -b axllm https://github.com/AXERA-TECH/ax-llm.git
2cd ax-llm
3./install.shaxllm):curl -fsSL https://raw.githubusercontent.com/AXERA-TECH/ax-llm/axllm/install.sh | bashhttps://github.com/AXERA-TECH/ax-llm/actions?query=branch%3Aaxllm
下载 最新 CI 导出的可执行程序(axllm),然后:1chmod +x axllm
2sudo mv axllm /usr/bin/axllmaxllm 二进制,可直接在本仓库目录下运行:1chmod +x ./bin/axllm
2./bin/axllm serve . --port 8000bin/axllm.version.json 中。1mkdir -p AXERA-TECH/HY-MT1.5-1.8B_GPTQ_INT4
2cd AXERA-TECH/HY-MT1.5-1.8B_GPTQ_INT4
3hf download AXERA-TECH/HY-MT1.5-1.8B_GPTQ_INT4 --local-dir .axllm run AXERA-TECH/HY-MT1.5-1.8B_GPTQ_INT4axllm serve AXERA-TECH/HY-MT1.5-1.8B_GPTQ_INT41from openai import OpenAI
2
3API_URL = "http://127.0.0.1:8000/v1"
4MODEL = "AXERA-TECH/HY-MT1.5-1.8B_GPTQ_INT4"
5
6messages = [
7 {"role": "system", "content": [{"type": "text", "text": "you are a helpful assistant."}]},
8 {"role": "user", "content": "hello"},
9]
10
11client = OpenAI(api_key="not-needed", base_url=API_URL)
12completion = client.chat.completions.create(
13 model=MODEL,
14 messages=messages,
15)
16
17print(completion.choices[0].message.content)1from openai import OpenAI
2
3API_URL = "http://127.0.0.1:8000/v1"
4MODEL = "AXERA-TECH/HY-MT1.5-1.8B_GPTQ_INT4"
5
6messages = [
7 {"role": "system", "content": [{"type": "text", "text": "you are a helpful assistant."}]},
8 {"role": "user", "content": "hello"},
9]
10
11client = OpenAI(api_key="not-needed", base_url=API_URL)
12stream = client.chat.completions.create(
13 model=MODEL,
14 messages=messages,
15 stream=True,
16)
17
18print("assistant:")
19for ev in stream:
20 delta = getattr(ev.choices[0], "delta", None)
21 if delta and getattr(delta, "content", None):
22 print(delta.content, end="", flush=True)
23print("
24")