Views
No views yet
main = v4-590(DeepSeek 重标注, F1 30.5%)。

基座: Qwen3-8B-Novel-Base-SFT | 方法: LoRA r=64 α=128 | 硬件: A800 80GB
[P1]...[P2]...{"boundaries": [N]} — N 为切分位置输入:
[P1] 下课铃响,教室里热闹起来。
[P2] 她低头收拾书包。
[P3] 我犹豫了一下,还是叫住了她。
[P4] 十分钟后,我们并肩走在校门外的街道上。
输出:
{"boundaries": [3]} ← P3后切scene(教室→校门外)1from transformers import AutoModelForCausalLM
2from peft import PeftModel
3
4base = AutoModelForCausalLM.from_pretrained(
5 "mikuhhn1239/qwen3-8b-novel-base-sft",
6 torch_dtype="auto", device_map="auto",
7)
8model = PeftModel.from_pretrained(
9 base, "mikuhhn1239/qwen3-8b-scene-segmentation-lora"
10)基座: Qwen3-8B-Novel-Base-SFT (Stage1 全参 SFT, 72K)
方法: LoRA (r=64, α=128, dropout=0.05)
框架: transformers Trainer + PEFT
优化器: AdamW (adamw_torch_fused), cosine schedule, warmup=5%
epoch: 5 | LR: 1e-4 | batch: 1×16(accum) | bf16 | max_length: 4096| 分支 | 版本 | F1 | 说明 |
|---|---|---|---|
main | v4-590 | 30.5% | DeepSeek 重标注,当前最佳 |
v4 | v4-590 | 30.5% | 同 main |
v3.1 | v3.1 | 28.6% | 人类 Clean 标注最佳(旧默认) |
v3 | v3 | 19.6% | 3ep 欠拟合 |
testing | v3.2 | 20.0% | reasons + 扩标,反退步 |
test-best | v2 | 53.3% | 史上最高但标注标准不同 |
| 版本 | train | 格式 | P | R | F1 | 说明 |
|---|---|---|---|---|---|---|
| v1 | 65 | 端到端 + reasons | 33.3 | 33.3 | 33.3% | 句子级粒度过细,不可比 |
| v2 | 280 | 纯边界 + reasons | 57.1 | 50.0 | 53.3% | test-best 分支,标注标准不同 |
| 版本 | train | prompt | 格式 | F1 | 说明 |
|---|---|---|---|---|---|
| v3 | 280 | 95 字 | 纯边界 | 19.6% | 3ep 欠拟合 |
| v3.1 | 280 | 95 字 | 纯边界 | 28.6% | 5ep,v3 标注最佳 |
| v3.2 | 384 | 735 字 | reasons | 20.0% | 长 prompt + reasons 退步 |
| v3.6 | 384 | 95 字 | 纯边界 | 28.2% | 追平 v3.1,验证短 prompt 是关键 |
| 版本 | 方法 | F1 | eval_loss | 退化策略 |
|---|---|---|---|---|
| v3.2 | 只列正样本 | 20.0% | ↗ | 猜位置 1,10,14 |
| v3.3 | 每对都判断 | 15.4% | → | 全 false + 1 true |
| v3.4 | 独立 pairwise | 12.0% | ↗↗ | 全 false |
| v3.5 | Best-of-N | 21.4% | — | FP 未抑制 |
| 版本 | train | 标注 | eval_loss | F1 | 亮点 |
|---|---|---|---|---|---|
| v4-296 | 296 | DeepSeek 初版 | 1.85→1.79 ↓ | 26.7% | 首次 eval_loss 下降 |
| v4-590 ⭐⭐ | 590 | DeepSeek 重标注 | 1.92→1.51 ↓ | 30.5% | 最稳健,跨密度泛化最好 |
| v4.1-1804 | 1804 | DeepSeek 扩标 | 1.74→1.32 ↓ | 29.9% | 三倍数据未超 v4-590,低质量标注稀释信号 |
| v4.1-582 | 582 | DeepSeek 精炼 | — | 30.2% | ≥2 边界占 76%,高密度泛化差(低密度仅 25.9%) |
结论:数据密度影响泛化。模型学会训练集的边界密度,密度不匹配时 F1 崩盘。扩标+精炼均未超越 v4-590 的 30.5%。
| 版本 | train | prompt | 标注 | F1 | 亮点 |
|---|---|---|---|---|---|
| v2 | 280 | 95 字 | 人类(v2标准) | 53.3% | 标注标准不同 |
| v4-590 ⭐⭐ | 590 | 95 字 | DeepSeek | 30.5% | 最稳健,跨密度泛化最好 |
| v4.1-582 | 582 | 95 字 | DeepSeek 精炼 | 30.2% | 高密度特化 |
| v4.1-1804 | 1804 | 95 字 | DeepSeek 扩标 | 29.9% | eval_loss 最低但未转化 F1 |
| v3.1 | 310 | 95 字 | 人类(v3Clean) | 28.6% | |
| v3.6 | 384 | 95 字 | 人类(v3Clean) | 28.2% |


| Agent | 模型 | 指标 |
|---|---|---|
| Agent 1: 叙事分类 | narrative-parsing-lora | acc 72.8% (v4) |
| Agent 3: 角色归因 | attribution-assist-lora | acc 86.7% (v3.2) |