Toward Faithful Retrieval-Augmented Generation with Sparse Autoencoders

Guangzhi Xiong, Zhenghao He, Bohan Liu, Sanchit Sinha, Aidong Zhang

ICLR 2026 arXiv ↗ Scholar ↗

Résumé

Resume traduit automatiquement a partir de la version anglaise originale.

La génération augmentée par récupération (RAG) améliore la factualité des grands modèles de langage (LLM) en ancrant les sorties dans des preuves récupérées, mais les défaillances de fidélité, où les générations contredisent ou dépassent les sources fournies, restent un défi majeur. Les méthodes existantes de détection d'hallucinations pour le RAG reposent souvent sur l'entraînement de détecteurs à grande échelle, nécessitant des données annotées substantielles, ou sur l'interrogation de juges LLM externes, entraînant des coûts d'inférence élevés. Bien que certaines approches tentent d'exploiter les représentations internes des LLM pour la détection d'hallucinations, leur précision reste limitée. Motivés par les avancées récentes en interprétabilité mécaniste, nous employons des autoencodeurs parcimonieux (SAE) pour démêler les activations internes, identifiant avec succès des caractéristiques spécifiquement déclenchées lors des hallucinations RAG. En nous appuyant sur un pipeline systématique de sélection de caractéristiques fondée sur l'information et de modélisation additive, nous introduisons RAGLens, un détecteur d'hallucinations léger qui signale avec précision les sorties RAG infidèles en utilisant les représentations internes du LLM. RAGLens atteint non seulement des performances de détection supérieures aux méthodes existantes, mais fournit aussi des justifications interprétables de ses décisions, permettant une mitigation post hoc efficace du RAG infidèle. Enfin, nous justifions nos choix de conception et révélons de nouveaux éclairages sur la distribution des signaux liés aux hallucinations au sein des LLM. Le code est disponible sur https://github.com/Teddy-XiongGZ/RAGLens.

Resume original (anglais)

Retrieval-Augmented Generation (RAG) improves the factuality of large language models (LLMs) by grounding outputs in retrieved evidence, but faithfulness failures, where generations contradict or extend beyond the provided sources, remain a critical challenge. Existing hallucination detection methods for RAG often rely either on large-scale detector training, which requires substantial annotated data, or on querying external LLM judges, which leads to high inference costs. Although some approaches attempt to leverage internal representations of LLMs for hallucination detection, their accuracy remains limited. Motivated by recent advances in mechanistic interpretability, we employ sparse autoencoders (SAEs) to disentangle internal activations, successfully identifying features that are specifically triggered during RAG hallucinations. Building on a systematic pipeline of information-based feature selection and additive feature modeling, we introduce RAGLens, a lightweight hallucination detector that accurately flags unfaithful RAG outputs using LLM internal representations. RAGLens not only achieves superior detection performance compared to existing methods, but also provides interpretable rationales for its decisions, enabling effective post-hoc mitigation of unfaithful RAG. Finally, we justify our design choices and reveal new insights into the distribution of hallucination-related signals within LLMs. The code is available at https://github.com/Teddy-XiongGZ/RAGLens.

Ce que cet article apporte

Les modèles RAG ignorent souvent les preuves récupérées lors de la génération. Nous utilisons des autoencodeurs parcimonieux pour décomposer le comportement de génération, identifier les caractéristiques responsables de la fidélité et les orienter — améliorant l'attribution et l'ancrage sans réentraîner le modèle de base.

BibTeX

@inproceedings{xiong2026faithful,
  title     = {Toward Faithful Retrieval-Augmented Generation with Sparse Autoencoders},
  author    = {Guangzhi Xiong and Zhenghao He and Bohan Liu and Sanchit Sinha and Aidong Zhang},
  booktitle = {International Conference on Learning Representations (ICLR)},
  year      = {2026},
  url       = {https://arxiv.org/abs/2512.08892}
}