Toward Faithful Retrieval-Augmented Generation with Sparse Autoencoders
Guangzhi Xiong, Zhenghao He, Bohan Liu, Sanchit Sinha, Aidong Zhang
Resumen
Resumen traducido automaticamente a partir del original en ingles.
La generación aumentada por recuperación (RAG) mejora la factualidad de los grandes modelos de lenguaje (LLM) al fundamentar las salidas en evidencia recuperada, pero los fallos de fidelidad, donde las generaciones contradicen o van más allá de las fuentes proporcionadas, siguen siendo un desafío crítico. Los métodos existentes de detección de alucinaciones para RAG a menudo dependen del entrenamiento de detectores a gran escala, que requiere datos anotados sustanciales, o de consultar jueces LLM externos, lo que conlleva altos costes de inferencia. Aunque algunos enfoques intentan aprovechar las representaciones internas de los LLM para la detección de alucinaciones, su precisión sigue siendo limitada. Motivados por los avances recientes en interpretabilidad mecanicista, empleamos autoencoders dispersos (SAE) para desenredar las activaciones internas, identificando con éxito características que se activan específicamente durante las alucinaciones de RAG. Sobre una canalización sistemática de selección de características basada en información y modelado aditivo de características, introducimos RAGLens, un detector ligero de alucinaciones que señala con precisión las salidas RAG infieles utilizando representaciones internas del LLM. RAGLens no solo logra un rendimiento de detección superior al de los métodos existentes, sino que también proporciona justificaciones interpretables de sus decisiones, habilitando una mitigación post hoc eficaz de RAG infiel. Finalmente, justificamos nuestras decisiones de diseño y revelamos nuevos conocimientos sobre la distribución de las señales relacionadas con alucinaciones dentro de los LLM. El código está disponible en https://github.com/Teddy-XiongGZ/RAGLens.
Resumen original (ingles)
Retrieval-Augmented Generation (RAG) improves the factuality of large language models (LLMs) by grounding outputs in retrieved evidence, but faithfulness failures, where generations contradict or extend beyond the provided sources, remain a critical challenge. Existing hallucination detection methods for RAG often rely either on large-scale detector training, which requires substantial annotated data, or on querying external LLM judges, which leads to high inference costs. Although some approaches attempt to leverage internal representations of LLMs for hallucination detection, their accuracy remains limited. Motivated by recent advances in mechanistic interpretability, we employ sparse autoencoders (SAEs) to disentangle internal activations, successfully identifying features that are specifically triggered during RAG hallucinations. Building on a systematic pipeline of information-based feature selection and additive feature modeling, we introduce RAGLens, a lightweight hallucination detector that accurately flags unfaithful RAG outputs using LLM internal representations. RAGLens not only achieves superior detection performance compared to existing methods, but also provides interpretable rationales for its decisions, enabling effective post-hoc mitigation of unfaithful RAG. Finally, we justify our design choices and reveal new insights into the distribution of hallucination-related signals within LLMs. The code is available at https://github.com/Teddy-XiongGZ/RAGLens.
Qué aporta este trabajo
Los modelos RAG a menudo ignoran la evidencia recuperada al generar. Usamos autoencoders dispersos para descomponer el comportamiento de generación, identificar los rasgos responsables de la fidelidad y dirigirlos — mejorando la atribución y el anclaje sin reentrenar el modelo base.
BibTeX
@inproceedings{xiong2026faithful,
title = {Toward Faithful Retrieval-Augmented Generation with Sparse Autoencoders},
author = {Guangzhi Xiong and Zhenghao He and Bohan Liu and Sanchit Sinha and Aidong Zhang},
booktitle = {International Conference on Learning Representations (ICLR)},
year = {2026},
url = {https://arxiv.org/abs/2512.08892}
}