Views
No views yet
NTT-hil-insight/VDocRetriever-Phi3-vision-pretrained, was pretrained on only OCR-image pairs NTT-hil-insight/VDocRetriever-Pretrain-DocStruct, for pre-training VDocRetriever with Vision Language Models (microsoft/Phi-3-vision-128k-instruct).NTT-hil-insight/VDocRetriever-Phi3-vision is a bi-encoder model designed to encode documents as unified image formats into dense vectors for document retrieval.1@inproceedings{tanaka2025vdocrag,
2 author = {Ryota Tanaka and
3 Taichi Iki and
4 Taku Hasegawa and
5 Kyosuke Nishida and
6 Kuniko Saito and
7 Jun Suzuki},
8 title = {VDocRAG: Retrieval-Augmented Generation over Visually-Rich Documents},
9 booktitle = {CVPR},
10 year = {2025}
11}