Views
No views yet
1pip install xinference[ggml]>=0.4.3
2pip install qwen-cppxinference -p 99971from xinference.client import Client
2
3client = Client("http://localhost:9997")
4model_uid = client.launch_model(
5 model_name="qwen-chat",
6 model_format="ggmlv3",
7 model_size_in_billions=7,
8 quantization="q4_0",
9 )
10model = client.get_model(model_uid)
11
12chat_history = []
13prompt = "最大的动物是什么?"
14model.chat(
15 prompt,
16 chat_history,
17 generate_config={"max_tokens": 1024}
18)