Views
No views yet
| 量化类型 | 文件大小 | 内存需求 | 推荐用途 | 下载链接 |
|---|---|---|---|---|
| Q2_K | 3.73 GB | ~4 GB | 极限内存环境 | 下载 |
| Q3_K_S | 4.28 GB | ~5 GB | 低内存设备 | 下载 |
| Q3_K_M | 4.63 GB | ~5 GB | 平衡性能/内存 | 下载 |
| Q3_K_L | 4.84 GB | ~6 GB | 稍好质量 | 下载 |
| Q4_0 | 5.08 GB | ~6 GB | 传统4位量化 | 下载 |
| Q4_1 | 5.60 GB | ~6 GB | 改进4位量化 | 下载 |
| Q4_K_S | 5.36 GB | ~6 GB | 推荐-小显卡 | 下载 |
| Q4_K_M | 5.74 GB | ~7 GB | 推荐-平衡 ⭐ | 下载 |
| Q5_0 | 6.11 GB | ~7 GB | 传统5位量化 | 下载 |
| Q5_1 | 6.62 GB | ~8 GB | 改进5位量化 | 下载 |
| Q5_K_S | 6.24 GB | ~7 GB | 高质量-小 | 下载 |
| Q5_K_M | 6.57 GB | ~8 GB | 高质量-中 | 下载 |
| Q6_K | 7.70 GB | ~9 GB | 接近原始质量 | 下载 |
| Q8_0 | 9.31 GB | ~11 GB | 最高质量 | 下载 |
| F16 | 17.52 GB | ~20 GB | 原始精度 | 下载 |
1# 下载模型和视觉投影器
2wget https://huggingface.co/Luckybalabala/AutoGLM-Phone-9B-Q4_K_M.gguf/resolve/main/AutoGLM-Phone-9B-Q4_K_M.gguf
3wget https://huggingface.co/Luckybalabala/AutoGLM-Phone-9B-Q4_K_M.gguf/resolve/main/AutoGLM-Phone-9B-mmproj.gguf
4
5# 启动服务器
6./llama-server -m AutoGLM-Phone-9B-Q4_K_M.gguf --mmproj AutoGLM-Phone-9B-mmproj.gguf --host 0.0.0.0 --port 80801# 克隆 Open-AutoGLM 项目
2git clone https://github.com/OpenBMB/AutoGLM.git
3cd AutoGLM
4
5# 配置模型 API
6python main.py --base-url http://localhost:8080/v1| 量化类型 | 推理速度 | 内存占用 | 质量保持 | 推荐场景 |
|---|---|---|---|---|
| Q2_K | 最快 | 最低 | 70% | 资源受限 |
| Q4_K_M | 快 | 中等 | 85% | 平衡推荐 |
| Q6_K | 中等 | 较高 | 95% | 高质量需求 |
| Q8_0 | 较慢 | 高 | 98% | 最佳质量 |
GLM-4V 多模态 手机自动化 GGUF 量化模型 llama.cpp