实验分析:
实验设置:
评估两个MLLMs,在六个数据集上,, LLaVA-Cap,
LLaVA-VQA, LLaVA-Rea, LRV, A-OKVQA, and Shikra。
BLIP-2和MiniGPT-4两个模型。选择这两个模型,是因为没有怎么使用指令集进行微调。
评估benchmark,MME和SEED-Bench。
实验结果:
分成了两组,: (A) LLaVA-Cap (image captioning),
LLaVA-VQA (visual question answering), and LLaVA-Rea
(visual reasoning); (B) LRV (diversity), A-OKVQA (com-
plexity), and Shikra (spatial annotation)。
从task type的角度,实验结果来看:
1. 在caption任务上训练,带来了明显的性能降低
2. MLLMs在reasoning任务上微调,带来了明显的性能提升。VQA task的训练中规中矩。
从Instruction特性角度:作者继续分析。作者的实验结果,表明,在A-OKVQA上进行微调,可以明显的提升性能。
在LRV和shikra上训练,仅带了小幅度的提升。
综合来看,LLaVA-rea和复杂度,A-OKVQA很有用。