UrbanIR: Large-Scale Urban Scene Inverse Rendering from a Single Video

Chih-Hao Lin, Bohan Liu, Yi-Ting Chen, Kuan-Sheng Chen, David Forsyth, Jia-Bin Huang, Anand Bhattad, Shenlong Wang

3DV 2025 arXiv ↗ Scholar ↗

Résumé

Resume traduit automatiquement a partir de la version anglaise originale.

Nous présentons UrbanIR (Urban Scene Inverse Rendering), un nouveau modèle de rendu inverse permettant des rendus réalistes à point de vue libre de scènes sous diverses conditions d'éclairage à partir d'une seule vidéo. Il infère avec précision la forme, l'albédo, la visibilité et l'éclairage du soleil et du ciel à partir de vidéos à grande ligne de base, comme celles de caméras embarquées, se différenciant des réglages de vues denses de NeRF. Dans ce contexte, les méthodes standard produisent souvent des estimations de géométrie et de matériaux médiocres, telles que des représentations imprécises des toits et de nombreux « floaters ». UrbanIR résout ces problèmes par de nouvelles pertes qui réduisent les erreurs d'inférence du rendu inverse et les artefacts de rendu. Ses techniques permettent une estimation précise des volumes d'ombre dans la scène originale. Les sorties du modèle prennent en charge l'édition contrôlable, permettant des rendus photoréalistes à point de vue libre de simulations nocturnes, de scènes rééclairées et d'objets insérés, marquant une amélioration significative par rapport aux méthodes de pointe existantes.

Resume original (anglais)

We present UrbanIR (Urban Scene Inverse Rendering), a new inverse graphics model that enables realistic, free-viewpoint renderings of scenes under various lighting conditions with a single video. It accurately infers shape, albedo, visibility, and sun and sky illumination from wide-baseline videos, such as those from car-mounted cameras, differing from NeRF's dense view settings. In this context, standard methods often yield subpar geometry and material estimates, such as inaccurate roof representations and numerous 'floaters'. UrbanIR addresses these issues with novel losses that reduce errors in inverse graphics inference and rendering artifacts. Its techniques allow for precise shadow volume estimation in the original scene. The model's outputs support controllable editing, enabling photorealistic free-viewpoint renderings of night simulations, relit scenes, and inserted objects, marking a significant improvement over existing state-of-the-art methods.

Ce que cet article apporte

Rendu inverse de scènes urbaines à grande échelle à partir d'une seule vidéo prise à la volée : décomposition de la ville en albédo, géométrie et éclairage transitoire, permettant un rééclairage et une édition photoréalistes bien au-delà des méthodes antérieures à image unique.

BibTeX

@inproceedings{lin2025urbanir,
  title     = {UrbanIR: Large-Scale Urban Scene Inverse Rendering from a Single Video},
  author    = {Chih-Hao Lin and Bohan Liu and Yi-Ting Chen and Kuan-Sheng Chen and David Forsyth and Jia-Bin Huang and Anand Bhattad and Shenlong Wang},
  booktitle = {International Conference on 3D Vision (3DV)},
  year      = {2025},
  url       = {https://arxiv.org/abs/2306.09349}
}