Xiaoyang Guo (郭晓阳)

I work on embodied foundation models, with a focus on world modeling, robot learning, and 3D perception.

Previously, I was a Principal Researcher at Horizon Robotics, leading research on 3D reconstruction and interactive driving simulation. I received my Ph.D. from CUHK MMLab, advised by Prof. Xiaogang Wang and Prof. Hongsheng Li, and my B.S. in Computer Science from Tsinghua University.

I am looking for research interns interested in embodied AI, 3D foundation models, and generative simulation. Please reach out by email.

profile photo

News

  • 2026.09: Released XPACE and IronMind, two technical reports on embodied world models and humanoid manipulation.
  • 2026.06: One paper accepted to ICML 2026 (EPS3D). SCOPE released on arXiv.
  • 2026.04: Four papers accepted to CVPR 2026: Scal3R (Highlight), LongStream, LiteVGGT, and VGGT4D.
  • 2026.03: CompoSIA accepted to ECCV 2026. Started working on embodied foundation models.
  • 2026.02: SAIL-Recon accepted as an Oral at 3DV 2026.
  • 2025.10: Three papers at ICCV 2025 (Epona, DM-Calib, StableDepth Highlight); RAD at NeurIPS 2025; SynthDrive and ComDrive at IROS 2025.

Selected Publications

* equal contribution; † project lead. Full list on Google Scholar.

IronMind research overview
IronMind: Scaling Humanoid Dexterous Manipulation via Camera-Space Ego-Centric Pretraining
Huimin Pan, Yufan Ren, Kunpeng Song, Siyang Wang, Xiwen Zhang, Xiaoyun Hu, Zhuoxu Duan, Hanrui Zheng, Jialeng Ni, Nathan Zhao, Sibo Ma, Zhenxuan Fan, Zhongyang Che, Danny Bao, Jiacheng Wei, Jerry Bai, Xiaoyu Yue, Xiaoyang Guo, Chenyi Chen
XPENG Technical Report, Arxiv'26  
[arXiv] [project page]
XPACE research overview
XPACE: Joint World and Action Modeling from Heterogeneous Experience
Jiacheng Wei*§, Jerry Bai*§, Xiaoyu Yue*, Zidong Wang*, Xiaoyang Guo*†, Cheng Chen, Fanqi Pu, Fan Wu, Zhixu Yue, Yizhuo Li, Feng Qiu, Bo Liu, Yuying Ge, Hui Zhou, Chenyi Chen, Yixiao Ge‡
XPENG Technical Report, Arxiv'26  
[arXiv] [project page]

For XPACE: * core contribution; § equal contribution; † project lead; ‡ supervision.

SCOPE research overview
SCOPE: Scale-Consistent One-Pass Estimation of 3D Geometry
Zheng Zhang, Lihe Yang, Tianyu Yang, Chaohui Yu, Yixing Lao, Xiaoyang Guo, Biao Gong, Fan Wang, Hengshuang Zhao
Preprint, Arxiv'26  
[arXiv]
EPS3D research overview
EPS3D: End-to-End Feed-Forward 3D Panoptic Segmentation
Runsong Zhu, Jiaxin Guo, Xiaoyang Guo†, Zhengzhe Liu, Ka-Hei Hui, Wei Yin, Kai Chen, Wei Chen, Weiqiang Ren, Yunhui Liu, Pheng-Ann Heng, Chi-Wing Fu
International Conference on Machine Learning, ICML'26  
[arXiv] [code]
Anchor3R research overview
Anchor3R: Streaming 3D Reconstruction with Transient Anchors for Long-Horizon Visual Mapping
Peilin Tao, Chong Cheng, Yuansen Du, Caiwei Song, Zhengqing Chen, Xiaoyang Guo, Wei Yin, Weiqiang Ren, Qian Zhang, Hainan Cui, Shuhan Shen
Preprint, Arxiv'26  
[arXiv]
HorizonStream research overview
HorizonStream: Long-Horizon Attention for Streaming 3D Reconstruction
Chong Cheng, Peilin Tao, Nanjie Yao, Guanzhi Ding, Xianda Chen, Yuansen Du, Xiaoyang Guo, Wei Yin, Weiqiang Ren, Qian Zhang, Zhengqing Chen, Hao Wang
Preprint, Arxiv'26  
[arXiv]
HorizonDrive research overview
HorizonDrive: Self-Corrective Autoregressive World Model for Long-horizon Driving Simulation
Conglang Zhang, Yifan Zhan, Qingjie Wang, Zhanpeng Ouyang, Yu Li, Zihao Yang, Xiaoyang Guo, Weiqiang Ren, Qian Zhang, Zhen Dong, Yinqiang Zheng, Wei Yin, Zhengqing Chen
Preprint, Arxiv'26  
[arXiv]
CompoSIA research overview
Composing Driving Worlds through Disentangled Control for Adversarial Scenario Generation
Yifan Zhan, Zhengqing Chen, Qingjie Wang, Zhuo He, Muyao Niu, Xiaoyang Guo, Wei Yin, Weiqiang Ren, Qian Zhang, Yinqiang Zheng
European Conference on Computer Vision, ECCV'26  
[arXiv] [project page] [code]
Scal3R research overview
Scal3R: Scalable Test-Time Training for Large-Scale 3D Reconstruction
Tao Xie, Peishan Yang, Yudong Jin, Yingfeng Cai, Wei Yin, Weiqiang Ren, Qian Zhang, Wei Hua, Sida Peng, Xiaoyang Guo†, Xiaowei Zhou†
Conference on Computer Vision and Pattern Recognition, CVPR'26   (Highlight)
[arXiv] [project page] [code]
LongStream research overview
LongStream: Long-Sequence Streaming Autoregressive Visual Geometry
Chong Cheng, Xianda Chen, Tao Xie, Wei Yin, Weiqiang Ren, Qian Zhang, Xiaoyang Guo†, Hao Wang
Conference on Computer Vision and Pattern Recognition, CVPR'26  
[arXiv] [project page]
LiteVGGT research overview
LiteVGGT: Boosting Vanilla VGGT via Geometry-Aware Cached Token Merging
Zhijian Shu, Cheng Lin, Tao Xie, Wei Yin, Ben Li, Zhiyuan Pu, Weize Li, Yao Yao, Xun Cao, Xiaoyang Guo, Xiao-Xiao Long
Conference on Computer Vision and Pattern Recognition, CVPR'26  
[arXiv] [project page]
VGGT4D research overview
VGGT4D: Mining Motion Cues in Visual Geometry Transformers for 4D Scene Reconstruction
Yu Hu*, Chong Cheng*, Sicheng Yu*, Xiaoyang Guo, Hao Wang
Conference on Computer Vision and Pattern Recognition, CVPR'26  
[arXiv] [project page] [code]
SynthDrive research overview
SynthDrive: Scalable Real2Sim2Real Sensor Simulation Pipeline for High-Fidelity Asset Generation and Driving Data Synthesis
Zhengqing Chen, Ruohong Mei, Xiaoyang Guo†, Qingjie Wang, Yubin Hu, Wei Yin, Weiqiang Ren, Qian Zhang
International Conference on Intelligent Robots and Systems, IROS'25  
[paper] [video]
ComDrive research overview
ComDrive: Comfort-Oriented End-to-End Autonomous Driving
Junming Wang, Xingyu Zhang, Zebin Xing, Songen Gu, Xiaoyang Guo, Yang Hu, Ziying Song, Qian Zhang, Xiaoxiao Long, Wei Yin
International Conference on Intelligent Robots and Systems, IROS'25  
[arXiv] [project page]
SAIL-Recon research overview
SAIL-Recon: Large SfM by Augmenting Scene Regression with Localization
Junyuan Deng, Heng Li, Tao Xie, Weiqiang Ren, Qian Zhang, Ping Tan, Xiaoyang Guo†
International Conference on 3D Vision, 3DV'26   (Oral)
[arXiv] [project page] [code]
RAD research overview
RAD: Training an End-to-End Driving Policy via Large-Scale 3DGS-Based Reinforcement Learning
Hao Gao, Shaoyu Chen, Bo Jiang, Bencheng Liao, Yiang Shi, Xiaoyang Guo, Yuechuan Pu, Haoran Yin, Xiangyu Li, Xinbang Zhang, Ying Zhang, Wenyu Liu, Qian Zhang, Xinggang Wang
Advances in Neural Information Processing Systems, NeurIPS'25  
[arXiv] [project page]
Epona research overview
Epona: Autoregressive Diffusion World Model for Autonomous Driving
Kaiwen Zhang, Zhenyu Tang, Xiaotao Hu, Xingang Pan, Xiaoyang Guo, Yuan Liu, Jingwei Huang, Li Yuan, Qian Zhang, Xiaoxiao Long, Xun Cao, Wei Yin
International Conference on Computer Vision, ICCV'25  
[arXiv] [project page] [code]
DM-Calib research overview
Boost 3D Reconstruction using Diffusion-based Monocular Camera Calibration
Junyuan Deng, Wei Yin, Xiaoyang Guo†, Qian Zhang, Xiaotao Hu, Weiqiang Ren, Xiao-Xiao Long, Ping Tan
International Conference on Computer Vision, ICCV'25  
[arXiv] [code]
DrivingWorld research overview
DrivingWorld: Constructing World Model for Autonomous Driving via Video GPT
Xiaotao Hu, Wei Yin, Mingkai Jia, Junyuan Deng, Xiaoyang Guo, Qian Zhang, Xiaoxiao Long, Ping Tan
Preprint, Arxiv'24  
[arXiv]
StableDepth research overview
StableDepth: Scene-Consistent and Scale-Invariant Monocular Depth
Zheng Zhang, Lihe Yang, Tianyu Yang, Chaohui Yu, Xiaoyang Guo, Yixing Lao, Hengshuang Zhao
International Conference on Computer Vision, ICCV'25   (Highlight)
[project page] [paper]
NGP-RT research overview
NGP-RT: Fusing Multi-Level Hash Features with Lightweight Attention for Real-Time Novel View Synthesis
Yubin Hu*, Xiaoyang Guo*, Yang Xiao, Jingwei Huang, Yong-Jin Liu
European Conference on Computer Vision, ECCV'24   (Realtime streamed on Petal Map App)
[arXiv] [paper]
SS3DM research overview
SS3DM: Benchmarking Street-View Surface Reconstruction with a Synthetic 3D Mesh Dataset
Yubin Hu, Kairui Wen, Heng Zhou, Xiaoyang Guo, Yong-Jin Liu
Advances in Neural Information Processing Systems, NeurIPS'24 (DB Track)  
[arXiv] [project page] [dataset]
ArrangementNet research overview
ArrangementNet: Learning Scene Arrangements for Vectorized Indoor Scene Modeling
Jingwei Huang, Shanshan Zhang, Bo Duan, Xiaoyang Guo, Minwei Sun, Li Yi
ACM Transactions on Graphics (TOG) , TOG'23   (Journal Track)
[paper]
LIGA-Stereo research overview
LIGA-Stereo: Learning Lidar Geometry aware Representations for Stereo-based 3d Detector
Xiaoyang Guo, Shaoshuai Shi, Xiaogang Wang, Hongsheng Li
International Conference on Computer Vision), ICCV'21   (Ranked 1st place among stereo-based 3D detection methods on KITTI (July 2021), refer to here.)
[arXiv] [project page] [paper] [code]
GwcNet research overview
Group-wise Correlation Stereo Network
Xiaoyang Guo, Kai Yang, Wukui Yang, Xiaogang Wang, Hongsheng Li
Conference on Computer Vision and Pattern Recognition, CVPR'19  
[arXiv] [paper] [code]
Unsupervised Cross-Spectral Stereo Matching by Learning to Synthesize research overview
Unsupervised Cross-Spectral Stereo Matching by Learning to Synthesize
Xiaoyang Guo*, Mingyang Liang*, Hongsheng Li, Xiaogang Wang, You Song
AAAI, AAAI'19   (Oral Presentation)
[arXiv] [paper]
Learning Monocular Depth by Distilling Cross-domain Stereo Networks research overview
Encap research overview
Neural Network Encapsulation
Hongyang Li, Xiaoyang Guo, Bo Dai, Wanli Ouyang, Xiaogang Wang
European Conference on Computer Vision, ECCV'18  
[arXiv] [paper]

Thanks for the template from Jon Barron .