Views
No views yet
base_model 均为真祖先 Qwen/Qwen3.6-27B(不是任何一个子代),因此所有
任务向量 Δ 都在同一个参考系里,叠加才有意义。
第三阶段把前两阶段的全部成果整体换锚:out = Cold-Fusion + (stage2 − Qwen3.6),
即把相对 Qwen3.6 的任务向量线性搬到基于 Qwen3.8 的 Cold-Fusion-GAIN-V1.1 上。
这一步逐位精确、无剪枝无随机,但跨代,其成立与否取决于两代基底是否对齐(见下方 cold_amp)。⚠️ 本次 v3 保留系数 W_V3 = 0.30(不是 1.00),输出为Qwen3.6 + 0.30·T(Δ_v3) + 1.00·Δ_ColdFusion。由于 β = 1.00,基底已完全落在 Cold-Fusion(Qwen3.8)上,α 只决定叠加多少 3.6 侧的任务向量。α 取 0.30 是实测标定而非拍脑袋:构造前测得 Cold-Fusion 相对官方 Qwen3.8 的位移只有 ≈0.7%‖W‖(即Cold-Fusion − Qwen3.6里 98.7% 是代际差、仅 1.3% 是它自己的微调),而 Δ_v3 在 MLP 上约 13%‖W‖ 且与其近乎正交(实测 cos = +0.005)。α=1.00 会用 ≈15 倍的音量把 Cold-Fusion 的行为盖掉;α=0.30 落到 MLP 的位移 ≈ δ_CF 的 4.6 倍(T 截断前)。
🧩 配套 adapter:YFC-112358/Qwen3.8-27B-Della-Deckard-Fable-Qwopus-ColdFusion-v4-LoRA—— 第三阶段的 T(Δ_v3) 另存为秩-48 PEFT LoRA(α 是加载时旋钮:lora_alpha = α×48;本仓 ≡ Cold-Fusion + 0.30·该方向),可贴到任何 Qwen3.8 系模型。embed_tokens / lm_head 因内存上限未做 T、不在 adapter 内。
1# ===== stage 1:造“通用智能复合体” G =====
2merge_method: della_linear
3base_model: Qwen/Qwen3.6-27B
4models:
5 - model: DavidAU/Qwen3.6-27B-V1.1-FF711-Darker-Hero-GAIN-H2.0
6 parameters: { weight: 0.90, density: 0.85 }
7 - model: YFC-112358/Qwen3.6-27B-Della-Deckard-Isometry-Geodesic-v2
8 parameters: { weight: 0.80, density: 0.85 }
9 - model: nightmedia/Qwen3.6-27B-Seven
10 parameters: { weight: 0.25, density: 0.55 }
11parameters:
12 epsilon: 0.30
13 lambda: 1.0
14 normalize: false
15 int8_mask: true
16dtype: float32
17out_dtype: bfloat16
18tokenizer: { source: "Qwen/Qwen3.6-27B" }1# ===== stage 2:G 对 #4,#4 主导 =====
2merge_method: task_arithmetic
3base_model: Qwen/Qwen3.6-27B
4models:
5 - model: KyleHessling1/Qwopus3.6-27B-Fusion-BF16
6 parameters: { weight: 1.00, density: 1.00 }
7 - model: ./stage1-G
8 parameters:
9 weight: [1.0, 1.0, 1.0, 1.0]
10 density: 1.00
11parameters:
12 epsilon: 0.30
13 lambda: 1.0
14 normalize: false
15 int8_mask: true
16dtype: float32
17out_dtype: bfloat16
18tokenizer: { source: "Qwen/Qwen3.6-27B" }1# ===== stage 3:把 stage2 的产物整体换锚到 Cold-Fusion(3.8) =====
2merge_method: task_arithmetic
3base_model: Qwen/Qwen3.6-27B
4models:
5 - model: DavidAU/Qwen3.8-27B-Cold-Fusion-GAIN-V1.1
6 parameters: { weight: 1.00 }
7 - model: ./stage2-out
8 parameters: { weight: 1.00 }
9parameters:
10 normalize: false
11 int8_mask: true
12dtype: float32
13out_dtype: bfloat16
14tokenizer: { source: "DavidAU/Qwen3.8-27B-Cold-Fusion-GAIN-V1.1" }out = ColdFusion + (stage2 − Qwen3.6):两个任务向量都以 Qwen/Qwen3.6-27B
为参考系、权重都是 1.00,所以 base + (CF − base) + (stage2 − base) = CF + stage2 − base。cold_amp 见下表:
同基底续训应落在 0.02~0.20,若接近 1.0 则是两次独立预训练,这一步加进去的是噪声。G = base + Σ Δ̃ᵢ,
立即用它算出 Δ_G = G − base 进入第二阶段。数学上与先落盘再读完全等价
(fp32 全程),但省了 ≈54 GB 的上传+下载。density ± epsilon ∈ (0,1);第一阶段的 0.85+0.30
越界会直接抛错。本模型逐源把 ε 收窄到合法上限(保留 0.02 余量),期望密度仍精确
等于各自的 density(fable 与 v2 的 density 都是 0.85 ⇒ ε 都被收窄到 0.13)。第二阶段两个源的 density 都是 1.00、不做剪枝,
ε 自动归零 —— 那一段没有任何随机性。| 指标 | 含义 | 中位值 |
|---|---|---|
| amp | ‖总增量‖ / ‖祖先权重‖ | 0.0202 |
| share | G 对 Qwopus 的质量比 | 26.002 |
| kill₂ | 第二阶段符号选举抹掉的非零占比 | 0.0% |
| cold_amp | ‖Qwen3.8·ColdFusion − Qwen3.6‖ / ‖Qwen3.6‖ | 0.1217 |
share = ‖w_G·Δ_G‖ / ‖Δ_qwopus‖。本配方不追求它小于 1:Qwopus 相对祖先的增量本就极小
(注意力/词表/输出头与祖先逐位相同,仅 MLP 相差 0.2~0.8%),所以 share 天然很大。
它在这里的作用只是诚实地给出两个来源的真实体量对比。1from transformers import AutoModelForCausalLM, AutoTokenizer
2m = AutoModelForCausalLM.from_pretrained("YFC-112358/Qwen3.8-27B-Della-Deckard-Fable-Qwopus-ColdFusion-v4", dtype="bfloat16", device_map="auto")
3t = AutoTokenizer.from_pretrained("YFC-112358/Qwen3.8-27B-Della-Deckard-Fable-Qwopus-ColdFusion-v4")temperature=0.7, top_p=0.8, top_k=20 起手。config/tokenizer 取自 Cold-Fusion(3.8)仓 —— 权重锚在那一侧。density: 1.00 让 MagPrune 退化成恒等映射(不排名、不伯努利采样、不 1/p 回缩),所以第二阶段严格等于 out = G + 1.00·(Qwopus − Qwen/Qwen3.6-27B),即 mergekit 的 task_arithmetic。这样做是因为逐源审计显示 Qwopus 相对祖先的增量集中在 MLP、幅度只有 0.2~0.8%:对这么小的增量再做 40% 剪枝,剪掉的是信号,留下的是噪声。out = Cold-Fusion(基于 Qwen3.8) + (stage2 − Qwen3.6) 成立的前提是两代权重活在同一个基底里(即 3.8 是从 3.6 续训而来)。两代架构逐字段相同,因此形状检查、加载、推理都不会报错 —— 它出错的方式是安静地变笨。构造时实测 cold_amp = 0.1217,同基底微调的参照区间是 0.02~0.20;若该值接近 1.0,请把本模型当实验品。另外 Cold-Fusion-GAIN-V1.1 在构造时仍处于作者标注的 cook #1 / working title 阶段,其权重可能已被替换;想精确复现请指定 commit。della_linear)。v2 与 Fable 的任务向量近乎正交(cos ≈ 0.01),选举会以 Fable 为多数方向,抹掉 v2 保留元素中的约一半(实测 kill 约 13%,量级正好是 v2 的一半),等于把 v2 的正交特征投影掉。为完整保留它,本次关闭选举。