Views
No views yet
| 版本 | 图像输入 | CNN 层数 | BN | 噪声 | 准确率 | GPU 利用率 |
|---|---|---|---|---|---|---|
| v01 | 32×32 | 2 | ❌ | ✅ | 72.3% | 34% |
| v02 | 128×128 | 3 | ✅ | ❌ | 86.7% | 78% |
核心升级:三层 CNN + BN + 高分辨率输入 → 解决「看不清图」「GPU 吃不饱」两大痛点
1模型训练完成时间:2025.10.31
2模型文件:multimodal_cifar10_epoch10.pth
3
4结构升级:
5 2层图像特征解析 → 3层解析层
6 新增:BatchNorm 层
7 移除:训练时噪声注入
8
9问题发现:
10 • 训练集分辨率过低(32×32),无法泛化到高分辨率图像
11 • 显卡算力增加,但利用率低(<40%)
12 • 可能原因:输入太小、batch_size 不足、数据加载瓶颈
13
14模型文件:
15 • multimodal_model_epoch50.pth
16 • multimodal_model_epoch50_1.pth
17
18结构:
19 • 双层图像特征解析
20 • BERT 预生成文本解码
21
22问题:
23 • 模型严重依赖文本提示
24 • 为逼模型学习图像,加入大量噪声
25 • 但 CNN 结构极简 → 学到的图像特征过于浅层
26
27下一步计划
28
29 -[ ] 升输入到 224×224
30 -[ ] 替换 CNN 为 ViT-tiny
31 -[ ] 加入 CLIP-style 对比学习
32 -[ ] 开放 Inference API