Views
No views yet
GPT2LMHeadModelGPT2LMHeadModel -> GPT2LMHeadModel1--- teacher model modules
2+++ student model modules
3@@ -4,7 +4,7 @@
4 (wpe): Embedding(1024, 768)
5 (drop): Dropout(p=0.1, inplace=False)
6 (h): ModuleList(
7- (0-11): 12 x GPT2Block(
8+ (0-5): 6 x GPT2Block(
9 (ln_1): LayerNorm((768,), eps=1e-05, elementwise_affine=True)
10 (attn): GPT2FlashAttention2(
11 (c_attn): Conv1D()
12396,00020231101.entrainDistillationObjective(logits_loss_component=LossComponent(label=logits, weight=1, loss_fn=kl), attn_loss_component=LossComponent(label=attn, weight=25, loss_fn=raw_mse, layer_mapper=layer-2, norm=layernorm, projector=mlp))0.00024842Adam with betas=(0.9,0.999) and epsilon=1e-08polynomial0.21.0DistillationObjective(logits_loss_component=LossComponent(label=logits, weight=1, loss_fn=kl), attn_loss_component=LossComponent(label=attn, weight=25, loss_fn=raw_mse, layer_mapper=layer-2, norm=layernorm, projector=mlp))True<torch.optim.lr_scheduler.LambdaLR object at 0x7fcf04823610>Nonedistilbert/distilgpt2NoneNone[('lm_head', False)]FalseNonegpt2FalseFalsewikimedia/wikipedia20231101.entraintext4000000.0110.01.00.20True