MM-SpuBench: Towards Better Understanding of Spurious Biases in Multimodal LLMs

Wenqian Ye, Bohan Liu, Guangtao Zheng, Di Wang, Yunsheng Ma, Xu Cao, Bolin Lai, James M. Rehg, Aidong Zhang

KDD 2026 arXiv ↗ Scholar ↗

Resumen

Resumen traducido automaticamente a partir del original en ingles.

El sesgo espurio, la tendencia a explotar correlaciones espurias entre atributos superficiales de la entrada y los objetivos de predicción, ha revelado un grave problema de robustez en el aprendizaje automático clásico. Los grandes modelos de lenguaje multimodales (MLLM), que aprovechan modelos de visión y lenguaje preentrenados, han demostrado recientemente una capacidad notable en la comprensión conjunta de visión y lenguaje. Sin embargo, tanto la presencia como la gravedad de los sesgos espurios en los MLLM siguen siendo poco comprendidas. En este trabajo abordamos esta brecha analizando los sesgos espurios en el entorno multimodal y descubriendo los patrones de datos en inferencia que pueden manifestar este problema. Para apoyar este análisis, introducimos MM-SpuBench, un conjunto de datos de referencia exhaustivo y verificado por humanos, compuesto por pares imagen-clase anotados con atributos centrales y espurios, basado en nuestra taxonomía de nueve tipos distintos de correlaciones espurias. El benchmark se construye con información de atributos interpretable por humanos para capturar una amplia gama de patrones espurios reflejo del conocimiento del mundo real. Utilizando este benchmark, realizamos una evaluación exhaustiva de los MLLM de código abierto y propietarios del estado del arte, tanto con precisión estándar como con la ventaja de verosimilitud de generación condicional propuesta (CGLA). Nuestros hallazgos destacan la persistencia de la dependencia de correlaciones espurias y la dificultad de su mitigación en nuestro benchmark. Esperamos que este trabajo inspire nuevos avances técnicos para mitigar estos sesgos. Nuestro benchmark está disponible públicamente en https://huggingface.co/datasets/mmbench/MM-SpuBench.

Resumen original (ingles)

Spurious bias, a tendency to exploit spurious correlations between superficial input attributes and prediction targets, has revealed a severe robustness pitfall in classical machine learning problems. Multimodal Large Language Models (MLLMs), which leverage pretrained vision and language models, have recently demonstrated strong capability in joint vision-language understanding. However, both the presence and severity of spurious biases in MLLMs remain poorly understood. In this work, we address this gap by analyzing the spurious biases in the multimodal setting and uncovering the specific inference-time data patterns that can manifest this problem. To support this analysis, we introduce MM-SpuBench, a comprehensive, human-verified benchmark dataset consisting of image-class pairs annotated with core and spurious attributes, grounded in our taxonomy of nine distinct types of spurious correlations. The benchmark is constructed using human-interpretable attribute information to capture a wide range of spurious patterns reflective of real-world knowledge. Leveraging this benchmark, we conduct a comprehensive evaluation of the state-of-the-art open-source and proprietary MLLMs with both standard accuracy and the proposed Conditional Generation Likelihood Advantage (CGLA). Our findings highlight the persistence of reliance on spurious correlations and the difficulty of mitigation on our benchmark. We hope this work can inspire new technical strides to mitigate these biases. Our benchmark is publicly available at https://huggingface.co/datasets/mmbench/MM-SpuBench.

Qué aporta este trabajo

Un benchmark de sesgos espurios en LLMs multimodales: conjuntos de imágenes emparejadas donde la respuesta correcta es independiente de las pistas espurias (fondos, textos superpuestos, coocurrencias). Revela que los MLLMs más potentes dependen fuertemente de atajos, lo que motiva una evaluación y mitigación conscientes del sesgo.

BibTeX

@inproceedings{ye2026mmspubench,
  title     = {MM-SpuBench: Towards Better Understanding of Spurious Biases in Multimodal LLMs},
  author    = {Wenqian Ye and Bohan Liu and Guangtao Zheng and Di Wang and Yunsheng Ma and Xu Cao and Bolin Lai and James M. Rehg and Aidong Zhang},
  booktitle = {ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD)},
  year      = {2026},
  url       = {https://arxiv.org/abs/2406.17126}
}