Views
No views yet
./data/.1# remove custom_hooks
2custom_hooks = []1test_dataset = [
2 dict(
3 type=MultipleChoiceDataset,
4 data_file='./data/eval/mmbench/MMBench_DEV_EN.tsv',
5 image_processor=image_processor,
6 pad_image_to_square=True,
7 ),
8 dict(
9 type=MultipleChoiceDataset,
10 data_file='./data/eval/mmbench/MMBench_TEST_EN.tsv',
11 image_processor=image_processor,
12 pad_image_to_square=True,
13 ),
14 dict(
15 type=MMEDataset,
16 data_file='./data/eval/mme/MME.tsv',
17 image_processor=image_processor,
18 pad_image_to_square=True,
19 ),
20 dict(
21 type=MultipleChoiceDataset,
22 data_file='./data/eval/seed_bench/SEEDBench_IMG.tsv',
23 image_processor=image_processor,
24 pad_image_to_square=True,
25 ),
26 dict(
27 type=MultipleChoiceDataset,
28 data_file='./data/eval/sqa/ScienceQA_VAL.tsv',
29 image_processor=image_processor,
30 pad_image_to_square=True,
31 ),
32 dict(
33 type=MultipleChoiceDataset,
34 data_file='./data/eval/sqa/ScienceQA_TEST.tsv',
35 image_processor=image_processor,
36 pad_image_to_square=True,
37 ),
38 dict(
39 type=MultipleChoiceDataset,
40 data_file='./data/eval/ai2d/AI2D_TEST.tsv',
41 image_processor=image_processor,
42 pad_image_to_square=True,
43 ),
44 dict(
45 type=MultipleChoiceDataset,
46 data_file='./data/eval/mmstar/MMStar.tsv',
47 image_processor=image_processor,
48 pad_image_to_square=True,
49 ),
50 dict(
51 type=HallusionDataset,
52 data_file='./data/eval/HallusionBench/HallusionBench.tsv',
53 image_processor=image_processor,
54 pad_image_to_square=True,
55 ),
56 dict(
57 type=POPEDataset,
58 data_file=[
59 './data/eval/pope/coco_pope_adversarial.json',
60 './data/eval/pope/coco_pope_popular.json',
61 './data/eval/pope/coco_pope_random.json',
62 ],
63 coco_val_path='./data/eval/val2014/',
64 image_processor=image_processor,
65 pad_image_to_square=True,
66 ),
67]
68
69test_dataloader = dict(
70 batch_size=1,
71 num_workers=0,
72 drop_last=False,
73 sampler=dict(type=DefaultSampler, shuffle=False),
74 dataset=dict(type=ConcatDataset, datasets=test_dataset),
75)
76test_evaluator = dict()
77test_cfg = dict(type=TestLoop, select_metric='first')1# example
2CUDA_VISIBLE_DEVICES=0,1,2,3,4,5,6,7,8 PYTHONPATH=. bash tools/dist.sh test projects/omg_llava/configs/test/omg_llava_7b_finetune_8gpus.py 8 --checkpoint ./pretrained/omg_llava/omg_llava_fintune_8gpus.pth| model | MMbench-DEV-EN | SEEDBench | MME | ScienceQA_VAL | ScienceQA_TEST | AI2D | MMStar |
|---|---|---|---|---|---|---|---|
| llava-vicuna-7b | 68.5 | 65.9 | 1689 | 67.6 | 68.9 | 56.7 | 34.8 |
| omg-llava-internlm2-7b | 45.7 | 54.2 | 1255 | 53.5 | 55.6 | 42.3 | 34.8 |