Views
No views yet
base_model 均为真祖先 Qwen/Qwen3.6-27B(不是任何一个子代),因此所有
任务向量 Δ 都在同一个参考系里,叠加才有意义。1# ===== stage 1:造“通用智能复合体” G =====
2merge_method: della_linear
3base_model: Qwen/Qwen3.6-27B
4models:
5 - model: DavidAU/Qwen3.6-27B-V1.1-FF711-Darker-Hero-GAIN-H2.0
6 parameters: { weight: 0.90, density: 0.85 }
7 - model: YFC-112358/Qwen3.6-27B-Della-Deckard-Isometry-Geodesic-v2
8 parameters: { weight: 0.80, density: 0.85 }
9 - model: nightmedia/Qwen3.6-27B-Seven
10 parameters: { weight: 0.25, density: 0.55 }
11parameters:
12 epsilon: 0.30
13 lambda: 1.0
14 normalize: false
15 int8_mask: true
16dtype: float32
17out_dtype: bfloat16
18tokenizer: { source: "Qwen/Qwen3.6-27B" }1# ===== stage 2:G 对 #4,#4 主导 =====
2merge_method: task_arithmetic
3base_model: Qwen/Qwen3.6-27B
4models:
5 - model: KyleHessling1/Qwopus3.6-27B-Fusion-BF16
6 parameters: { weight: 1.00, density: 1.00 }
7 - model: ./stage1-G
8 parameters:
9 weight: [1.0, 1.0, 1.0, 1.0]
10 density: 1.00
11parameters:
12 epsilon: 0.30
13 lambda: 1.0
14 normalize: false
15 int8_mask: true
16dtype: float32
17out_dtype: bfloat16
18tokenizer: { source: "Qwen/Qwen3.6-27B" }G = base + Σ Δ̃ᵢ,
立即用它算出 Δ_G = G − base 进入第二阶段。数学上与先落盘再读完全等价
(fp32 全程),但省了 ≈54 GB 的上传+下载。density ± epsilon ∈ (0,1);第一阶段的 0.85+0.30
越界会直接抛错。本模型逐源把 ε 收窄到合法上限(保留 0.02 余量),期望密度仍精确
等于各自的 density(fable 与 v2 的 density 都是 0.85 ⇒ ε 都被收窄到 0.13)。第二阶段两个源的 density 都是 1.00、不做剪枝,
ε 自动归零 —— 那一段没有任何随机性。| 指标 | 含义 | 中位值 |
|---|---|---|
| amp | ‖总增量‖ / ‖祖先权重‖ | 0.0202 |
| share | G 对 Qwopus 的质量比 | 26.002 |
| kill₂ | 第二阶段符号选举抹掉的非零占比 | 0.0% |
| cold_amp | ‖Qwen3.8·ColdFusion − Qwen3.6‖ / ‖Qwen3.6‖ | 0.1217 |
share = ‖w_G·Δ_G‖ / ‖Δ_qwopus‖。本配方不追求它小于 1:Qwopus 相对祖先的增量本就极小
(注意力/词表/输出头与祖先逐位相同,仅 MLP 相差 0.2~0.8%),所以 share 天然很大。
它在这里的作用只是诚实地给出两个来源的真实体量对比。1from transformers import AutoModelForCausalLM, AutoTokenizer
2m = AutoModelForCausalLM.from_pretrained("YFC-112358/Qwen3.6-27B-Della-Deckard-Fable-Qwopus-v3", dtype="bfloat16", device_map="auto")
3t = AutoTokenizer.from_pretrained("YFC-112358/Qwen3.6-27B-Della-Deckard-Fable-Qwopus-v3")temperature=0.7, top_p=0.8, top_k=20 起手。config/tokenizer 取自祖先仓。density: 1.00 让 MagPrune 退化成恒等映射(不排名、不伯努利采样、不 1/p 回缩),所以第二阶段严格等于 out = G + 1.00·(Qwopus − Qwen/Qwen3.6-27B),即 mergekit 的 task_arithmetic。这样做是因为逐源审计显示 Qwopus 相对祖先的增量集中在 MLP、幅度只有 0.2~0.8%:对这么小的增量再做 40% 剪枝,剪掉的是信号,留下的是噪声。della_linear)。v2 与 Fable 的任务向量近乎正交(cos ≈ 0.01),选举会以 Fable 为多数方向,抹掉 v2 保留元素中的约一半(实测 kill 约 13%,量级正好是 v2 的一半),等于把 v2 的正交特征投影掉。为完整保留它,本次关闭选举。