2026
Towards Robustness against Typographic Attack with Training-free Concept Localization
Bohan Liu, Wenqian Ye, Guangzhi Xiong, Zhenghao He, Sanchit Sinha, Aidong Zhang

畫在圖片上的文字不應決定模型看到什麼。我們免訓練地定位出讀取注入文字的少量CLIP注意力頭,並對其重新加權或消融。在RTA-100(ViT-H/14)上物件準確率提升22.8分,測試成本趨近於零,在五種主幹網路上超越監督式與免訓練防禦。
MM-SPUBench: Towards Better Understanding of Spurious Biases in Multimodal LLMs
Wenqian Ye, B Liu, G Zheng, D Wang, X Cao, Y Ma, B Lai, JM Rehg, A Zhang
多模態LLM虛假偏誤基準測試:成對影像集使正確答案與虛假線索(背景、文字覆蓋、共現)無關。結果顯示強大的MLLM嚴重依賴捷徑,促使具偏誤意識的評估與緩解。
Attention-guided Fine-tuning of Multimodal Large Language Models Improves Chain-of-Thought Reasoning
S Sinha, G Xiong, B Liu, Z He, A Zhang
arXiv Jun 2026 論文 ↗

僅微調多模態LLM的少數注意力圖(而非權重)即可改善思維鏈推理。注意力引導式更新在保留模型知識的同時控制其「看向何處」,以遠低於完整微調的成本提升ChartQA與CoT基準。
Toward Faithful Retrieval-Augmented Generation with Sparse Autoencoders
G Xiong, Z He, B Liu, S Sinha, A Zhang
RAG模型生成時常忽略檢索到的證據。我們利用稀疏自編碼器分解生成行為,找出影響忠實性的特徵並加以導引——無需重新訓練基礎模型即可改善歸因與依據。
SAGE: Spuriousness-Aware Guided Prompt Exploration for Mitigating Multimodal Bias
W Ye, D Wang, G Zheng, B Liu, A Zhang
提示層級的多模態偏誤防禦:SAGE估計提示的「虛假意識」程度,並探索引導式提示變體,找出模型依賴真實視覺內容而非資料集捷徑的表述方式。
Reasoning Beyond Chain-of-Thought: A Latent Computational Mode in Large Language Models
Z He, G Xiong, B Liu, S Sinha, A Zhang

思維鏈並非LLM唯一的推理方式。我們發現一種潛在計算模式——推理在發出任何token之前即於隱藏狀態中完成——並刻畫潛在計算優於顯式CoT的條件。
2025
UrbanIR: Large-Scale Urban Scene Inverse Rendering from a Single Video
CH Lin, B Liu, YT Chen, KS Chen, D Forsyth, JB Huang, A Bhattad, et al.
從單段隨手拍攝的影片進行大規模都市場景逆渲染:將城市分解為反照率、幾何與瞬態光照,實現遠超以往單張影像方法的擬真重光照與編輯。
2022
Online Classifier of AMICA Model to Evaluate State Anxiety While Standing in Virtual Reality
G Liao, S Wang, Z Wei, B Liu, R Okubo, ME Hernandez
基於AMICA腦電特徵的線上分類器,可在人於虛擬實境中站立時偵測狀態焦慮——可應用於跌倒預防與VR治療的即時監測。