Views
No views yet
mediasynthesismuseum/attngan-coco.coco_AttnGAN2.pth — the 3-stage generator G_NET (GF_DIM=48, R_NUM=3, Z_DIM=100).text_encoder100.pth — the DAMSM bi-LSTM RNN_ENCODER (EMBEDDING_DIM=256).captions.pickle — COCO caption metadata; provides ixtoword/wordtoix (vocab 27,297).model.py, GlobalAttention.py — the network definitions.1cfg.GAN.GF_DIM=48; cfg.GAN.R_NUM=3; cfg.TREE.BRANCH_NUM=3 # COCO config
2text_encoder = RNN_ENCODER(27297, nhidden=256); text_encoder.load_state_dict(torch.load("text_encoder100.pth"))
3netG = G_NET(); netG.load_state_dict(torch.load("coco_AttnGAN2.pth"))
4# tokenize caption via wordtoix -> text_encoder -> netG(noise, sent_emb, words_embs, mask)
5# final image = fake_imgs[-1] (256x256, in [-1,1])