MM-SpuBench: Towards Better Understanding of Spurious Biases in Multimodal LLMs

Wenqian Ye, Bohan Liu, Guangtao Zheng, Di Wang, Yunsheng Ma, Xu Cao, Bolin Lai, James M. Rehg, Aidong Zhang

KDD 2026 arXiv ↗ Scholar ↗

Résumé

Resume traduit automatiquement a partir de la version anglaise originale.

Le biais fallacieux, tendance à exploiter des corrélations fallacieuses entre des attributs superficiels de l'entrée et les cibles de prédiction, a révélé une faille de robustesse majeure dans les problèmes classiques d'apprentissage automatique. Les grands modèles de langage multimodaux (MLLM), qui s'appuient sur des modèles de vision et de langage pré-entraînés, ont récemment démontré de fortes capacités de compréhension conjointe vision-langage. Cependant, la présence et la sévérité des biais fallacieux dans les MLLM restent mal comprises. Dans ce travail, nous comblons cette lacune en analysant les biais fallacieux en contexte multimodal et en découvrant les schémas de données en inférence qui peuvent manifester ce problème. Pour soutenir cette analyse, nous introduisons MM-SpuBench, un jeu de données de référence complet et vérifié par des humains, composé de paires image-classe annotées d'attributs fondamentaux et fallacieux, fondé sur notre taxonomie de neuf types distincts de corrélations fallacieuses. La référence est construite avec des informations d'attributs interprétables par l'humain afin de capturer un large éventail de schémas fallacieux reflétant les connaissances du monde réel. En utilisant cette référence, nous menons une évaluation complète des MLLM open source et propriétaires de pointe, à la fois avec la précision standard et l'avantage de vraisemblance de génération conditionnelle proposé (CGLA). Nos résultats soulignent la persistance de la dépendance aux corrélations fallacieuses et la difficulté de mitigation sur notre référence. Nous espérons que ce travail inspirera de nouvelles avancées techniques pour atténuer ces biais. Notre référence est publiquement disponible sur https://huggingface.co/datasets/mmbench/MM-SpuBench.

Resume original (anglais)

Spurious bias, a tendency to exploit spurious correlations between superficial input attributes and prediction targets, has revealed a severe robustness pitfall in classical machine learning problems. Multimodal Large Language Models (MLLMs), which leverage pretrained vision and language models, have recently demonstrated strong capability in joint vision-language understanding. However, both the presence and severity of spurious biases in MLLMs remain poorly understood. In this work, we address this gap by analyzing the spurious biases in the multimodal setting and uncovering the specific inference-time data patterns that can manifest this problem. To support this analysis, we introduce MM-SpuBench, a comprehensive, human-verified benchmark dataset consisting of image-class pairs annotated with core and spurious attributes, grounded in our taxonomy of nine distinct types of spurious correlations. The benchmark is constructed using human-interpretable attribute information to capture a wide range of spurious patterns reflective of real-world knowledge. Leveraging this benchmark, we conduct a comprehensive evaluation of the state-of-the-art open-source and proprietary MLLMs with both standard accuracy and the proposed Conditional Generation Likelihood Advantage (CGLA). Our findings highlight the persistence of reliance on spurious correlations and the difficulty of mitigation on our benchmark. We hope this work can inspire new technical strides to mitigate these biases. Our benchmark is publicly available at https://huggingface.co/datasets/mmbench/MM-SpuBench.

Ce que cet article apporte

Un benchmark des biais fallacieux dans les LLM multimodaux : des paires d'images où la bonne réponse est indépendante des indices fallacieux (arrière-plans, textes superposés, cooccurrences). Révèle que les MLLM performants s'appuient fortement sur des raccourcis, motivant une évaluation et une atténuation conscientes des biais.

BibTeX

@inproceedings{ye2026mmspubench,
  title     = {MM-SpuBench: Towards Better Understanding of Spurious Biases in Multimodal LLMs},
  author    = {Wenqian Ye and Bohan Liu and Guangtao Zheng and Di Wang and Yunsheng Ma and Xu Cao and Bolin Lai and James M. Rehg and Aidong Zhang},
  booktitle = {ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD)},
  year      = {2026},
  url       = {https://arxiv.org/abs/2406.17126}
}