Views
No views yet
sensenova/SenseNova-U1.5-8B-MoT(官方正式版,非 Preview)按 hoidhxd
社区版 hoidhxd/SenseNova-U1.5-8B-GGUF-v2 的量化规范复刻为 Q4_0 GGUF。| 文件 | 说明 | 大小 |
|---|---|---|
output/SenseNova-U1.5-8B-MoT-Q4_0.gguf | 量化后的 GGUF(权重) | 10,875,444,576 B ≈ 10.13 GiB |
output/SenseNova-U1.5-8B-MoT-Q4_0.gguf.plan.json | 逐张量类型清单(喂给加载侧的可选清单) | 216 KB |
文件大小与 hoidhxd 版SenseNova-U1.5-8B-MoT-Preview-Q4_0-v2.gguf(同样 10,875,444,576 B)一致,说明量化规则、张量类型分布与其规范完全一致。
| 类型 | 规则 | 数量 |
|---|---|---|
| Q4_0 | 大型 2D Linear 权重:42 层 attention(q/k/v/o)与 MLP(gate/up/down)、各自的 _mot_gen 分支、lm_head 等 | 589 |
| F32 | 1D 张量(bias、LayerNorm/RMSNorm 等)及参数量 ≤1024 的小张量 | 516 |
| F16 | 故意保持稠密(dense)以避坑的 11 个张量:embed_tokens(Embedding)、6 个 Conv2d kernel(patch_embedding、dense_embedding、fm_head.conv1/2 × vision 与 _mot_gen 两分支)、timestep_embedder/noise_scale_embedder 的 mlp.{0,2}.weight | 11 |
nn.Linear,若把 Embedding/Conv/kernel
误量化为 Q4_0 会导致加载时崩溃。这 11 个张量显式保留为 dense(F16),
其余大 Linear 全部 Q4_0,既保证兼容性又保持图像质量。general.architecture = sensenova_u1.5
general.quantization_version = 2
general.file_type = 2 # MOSTLY_Q4_0plan.json 与 hoidhxd 版
SenseNova-U1.5-8B-MoT-Preview-Q4_0-v2.gguf.plan.json 全 1116 个张量
(name/shape/type)一致:0 缺失、0 多余、0 类型差异、0 形状差异。gguf.GGUFReader 成功解析全部 1116 个张量;
Q4_0 张量可正确反量化(shape 还原、数值合理)。general.architecture=sensenova_u1.5、
general.file_type=2(MOSTLY_Q4_0)、general.quantization_version=2。1# 0. 依赖
2pip install gguf safetensors numpy ml_dtypes
3
4# 1. 下载原版权重(13 分片 ~46.7 GB)到 models/
5python src/download_model.py # 默认从 ModelScope 国内镜像
6# 断点续传/单文件:python src/download_model.py <分片名>
7
8# 2. 用 hoidhxd 的 plan 作为类型规则源(已存于 src/hoidhxd_plan.json)
9
10# 3. 量化(全部 13 分片;单分片可加参数)
11python src/quantize.py # 产出 output/*.gguf + *.plan.json
12
13# 4. 校验
14python src/check_models.py # 权重完整性
15python src/compare_plans.py output/SenseNova-U1.5-8B-MoT-Q4_0.gguf.plan.json src/hoidhxd_plan.json<ComfyUI>/models/gguf/(注意不是 models/unet/)。ComfyUI-SenseNova-U1 自定义节点及其依赖
(pip install "gguf>=0.10.0" "diffusers>=0.30.0" accelerate transformers)。model_path 指向含 config.json/tokenizer 的目录(只需
*.json *.txt,无需 50GB 权重)。device=cuda、dtype=bfloat16、device_map=none、
vram_mode=full(16GB)/balanced(12GB)、gguf_checkpoint 选本文件。models/ # 原版 13 个 safetensors 分片 + config/tokenizer(~46.7 GB,量化后可按需删除)
output/ # 量化产物(11 GB)
src/ # 脚本 + hoidhxd_plan.json 规则源