Views
No views yet
2024-06-186.9GB2004-06-18
1. 优化模型量化损失
2004-06-06 00:20
1. 模型重新校准
2. 修复layernorm_epsilon数值不对的问题
3. 修复一些设备不能双卡运行的问题(可能不能完全解决)
2004-06-05 21:00
1. 尝试修复!!!感叹号吐字问题
2. group_size 调整为64,减少量化精度损失AWQ 与 GPTQ 量化算法的量化策略。带有量化修复标签的Int3模型,可以比肩默认AWQ与GPTQ算法的Int8模型的能力。1.乱吐字、2.无限循环、3.长文能力丢失等量化损失造成的模型不可用的情况。AWQ与GPTQ模型在能力上没有表现出明显区别。同时考虑到GPTQ的vLLM引擎的并发推理效率最好,所以不再制作AWQ模型。1from modelscope import snapshot_download
2model_dir = snapshot_download('tclf90/模型名', cache_dir="本地路径")>>> python -m vllm.entrypoints.openai.api_server --model 本地路径/tclf90/模型名称