Views
No views yet

mikuhhn1239/qwen3-8b-narrative-parsing-lora — 叙事单元分类mikuhhn1239/qwen3-8b-scene-segmentation-lora — 场景边界检测mikuhhn1239/qwen3-8b-attribution-assist-lora — 角色归因1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained(
4 "mikuhhn1239/qwen3-8b-novel-base-sft",
5 torch_dtype="auto",
6 device_map="auto",
7)
8tokenizer = AutoTokenizer.from_pretrained(
9 "mikuhhn1239/qwen3-8b-novel-base-sft"
10)1from transformers import BitsAndBytesConfig
2
3bnb_config = BitsAndBytesConfig(
4 load_in_4bit=True,
5 bnb_4bit_compute_dtype="float16",
6 bnb_4bit_quant_type="nf4",
7)
8model = AutoModelForCausalLM.from_pretrained(
9 "mikuhhn1239/qwen3-8b-novel-base-sft",
10 quantization_config=bnb_config,
11 device_map="auto",
12)| 文件 | 条数 | 说明 |
|---|---|---|
continuation.jsonl | 36,092 | 续写:给前半段→续后半段 |
instruction.jsonl | 36,481 | 指令式续写 |
| 合计 | 72,573 |
[system, user, assistant]| # | 问题 | 原因 | 解决 |
|---|---|---|---|
| 1 | 单卡 OOM (78G/80G) | optimizer+grads+model≈116G/卡 | 上 4 卡 DDP |
| 2 | 4 卡 DDP 仍 OOM (79G/80G) | DDP 每卡存完整 AdamW 状态(66G) | 加 DeepSpeed ZeRO-2 |
| 3 | ZeRO-2 backward OOM | 内存碎片 | PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True |
| 4 | batch=2 预估 26 小时 | 序列太长 | seq_len 4096→2048, epochs 3→2, batch 2→4 |
| 参数 | 值 |
|---|---|
| 方法 | 全参数 SFT |
| 有效 batch size | 64 (4 GPU × 4 batch × 4 accumulation) |
| 学习率 | 2e-5 |
| 优化器 | AdamW (adamw_torch_fused) |
| warmup | 3% |
| scheduler | linear decay |
| 精度 | bf16 |
| 最大序列长度 | 2048 |
| epochs | 2 |
| gradient checkpointing | True |
| 分布式 | DeepSpeed ZeRO-2 (4×A800 80GB) |