Views
No views yet
| 能力 | 说明 |
|---|---|
| 推理速度 | CPU 环境下可获得 2-5x 提升 |
| 架构解耦 | 视觉模块仍在 PyTorch 中运行,便于调试与扩展 |
| API 兼容 | 保持与 OpenAI 风格接口一致,可无缝集成现有应用 |
| 本地化 | 全流程离线部署,无外部服务依赖 |
| 内存优化 | 使用微缩版视觉模型,节省约 7GB 内存 |
PaddleOCR-VL-half-GGUF-pured/
├── demo_ppocrvl_gguf_server.py # llama.cpp 后端服务器 (核心)
├── demo_ppocrvl_gguf_client.py # 命令行客户端示例
├── requirements.txt # 运行所需的 Python 依赖
├── README.md # 本文档
├── readme_example.md # 详细示例和转换说明
├── gguf_model/ # 转换后的 GGUF 模型文件
│ ├── llm_model.gguf # FP16 精度 GGUF 模型
│ ├── llm_model_q4.gguf # Q4 量化 GGUF 模型
│ └── llm_model_q8.gguf # Q8 量化 GGUF 模型
└── vision_model/ # 微缩版视觉模型文件
├── added_tokens.json
├── chat_template.jinja
├── image_processing.py
├── model_info.json
├── preprocessor_config.json
├── processing_paddleocr_vl.py
├── processor_config.json
├── special_tokens_map.json
├── tokenizer_config.json
├── tokenizer.json
├── tokenizer.model
└── vision_model.ptpip install -r requirements.txt1# 启动多模态服务
2python demo_ppocrvl_gguf_server.py1# 在另一个终端中运行客户端测试
2python demo_ppocrvl_gguf_client.py1import requests
2
3# 示例:发送包含图像的 OCR 请求
4payload = {
5 "messages": [
6 {
7 "role": "user",
8 "content": [
9 {"type": "text", "text": "OCR:"},
10 {"type": "image_url", "image_url": {"url": "data:image/jpeg;base64,..."}}
11 ]
12 }
13 ]
14}
15
16response = requests.post("http://localhost:8000/v1/chat/completions", json=payload)
17print(response.json())demo_ppocrvl_gguf_server.py 中可以调整以下参数:1VISION_MODEL_PATH = "vision_model" # 视觉模型路径
2GGUF_MODEL_PATH = "gguf_model/llm_model_q4.gguf" # GGUF 模型路径
3N_GPU_LAYERS = 0 # GPU 层数 (0=纯 CPU)
4N_CTX = 4096 # 上下文窗口
5N_THREADS = 8 # CPU 线程数llm_model.gguf: FP16 精度,质量最高,内存占用最大llm_model_q8.gguf: Q8 量化,平衡质量和内存llm_model_q4.gguf: Q4 量化,内存最小,推荐用于 CPU 推理