Views
No views yet
1from transformers import AutoProcessor, AutoModelForVision2Seq
2
3# Load model and processor
4processor = AutoProcessor.from_pretrained("sugiv/smolvlm-dse")
5model = AutoModelForVision2Seq.from_pretrained("sugiv/smolvlm-dse")
6
7# Process query
8query_inputs = processor(
9 text=query_text,
10 return_tensors="pt",
11 padding=True,
12 truncation=True
13)
14
15# Process document image
16image_inputs = processor(
17 images=document_image,
18 return_tensors="pt"
19)
20
21# Get embeddings
22query_embedding = model.encode_query(query_inputs)
23doc_embedding = model.encode_passage(image_inputs)deepspeed --include localhost:0 --master_port 60000 train.py \
--deepspeed ds_zero2_config.json \
--output_dir retriever-smolvlm \
--model_name_or_path HuggingFaceTB/SmolVLM-256M-Base \
--save_steps 50 \
--dataset_name Tevatron/wiki-ss-nq \
--corpus_name Tevatron/wiki-ss-corpus \
--cache_dir ./cached_datasets \
--query_prefix "Query: " \
--passage_prefix "Passage: " \
--bf16 \
--pooling last \
--normalize \
--temperature 0.02 \
--per_device_train_batch_size 8 \
--gradient_checkpointing \
--train_group_size 16 \
--learning_rate 1e-5 \
--weight_decay 0.01 \
--query_max_len 128 \
--passage_max_len 512 \
--num_train_epochs 1