Views
No views yet
python3 train.py --text_column_name text --image_column_name imgpython3 train.py --pretrained_model_name_or_path ohgnues/ImageTextRetrievalpython3 train.py --name 2m_random_50k --cache_dir /data/.cache --max_length 100 --num_train_epochs 101 def encode(self, model_name: Literal["text", "image"],
2 input_ids: Optional[torch.Tensor] = None,
3 attention_mask: Optional[torch.Tensor] = None,
4 token_type_ids: Optional[torch.Tensor] = None,
5 position_ids: Optional[torch.Tensor] = None,
6 head_mask: Optional[torch.Tensor] = None,
7 inputs_embeds: Optional[torch.Tensor] = None,
8 output_attentions: Optional[bool] = None,
9 output_hidden_states: Optional[bool] = None,
10 return_dict: Optional[bool] = None,
11 pixel_values: Tensor = None
12 ):
13
14 if model_name == "text":
15 return self.text_encoder(
16 input_ids,
17 attention_mask=attention_mask,
18 token_type_ids=token_type_ids,
19 position_ids=position_ids,
20 head_mask=head_mask,
21 inputs_embeds=inputs_embeds,
22 output_attentions=output_attentions,
23 output_hidden_states=output_hidden_states,
24 return_dict=return_dict,
25 ).last_hidden_state[:, 0, :]
26
27 elif model_name == "image":
28 return self.image_encoder(
29 pixel_values=pixel_values,
30 output_hidden_states=output_hidden_states,
31 ).pooler_output[:, :, 0, 0]