Portrait of Sifei Liu

Curriculum Vitae

Sifei Liu

Principal Research Scientist / Tech Lead · NVIDIA Research

I am a Principal Research Scientist and Tech Lead at NVIDIA Research, where I work with the LPR team led by Jan Kautz. My current research focuses on embodied foundational models, efficient transformer architectures, and spatial reasoning. I am deeply involved in VLM and VLA foundation model efforts across Cosmos and Isaac GR00T.

Before joining NVIDIA, I earned my Ph.D. at the VLLAB at UC Merced, advised by Ming-Hsuan Yang. I have been fortunate to receive the Baidu Graduate Fellowship, the NVIDIA Pioneering Research Award, and the Rising Star EECS recognition.

NVIDIA Research

Principal Research Scientist · Learning and Perception Research

  • Leading Spatial Reasoning in NVIDIA Cosmos 3.
  • Tech Lead of the Embodied Reasoning Project (Ember), advancing Robot System 2 models.
  • Develop efficient multimodal architectures, including GSPN-family spatial propagation and token-efficient high-resolution vision-language models.

NVIDIA Research

Research Intern · Learning and Perception Research

The Chinese University of Hong Kong

Visiting Scholar · Multimedia Laboratory (MMLab)

Baidu

Applied Scientist Intern · Institute of Deep Learning; face parsing and computational photography.

University of California, Merced

Ph.D. in Electrical Engineering and Computer Science

Advised by Ming-Hsuan Yang.

University of Science and Technology of China

M.S. in Electronic Engineering and Information Sciences

Advised by Stan Z. Li and Bin Li.

North China Electric Power University

Bachelor's in Control Science

2019

Rising Stars in EECS

2017

NVIDIA Pioneering Research Award

2013

Baidu Graduate Fellowship

Research Record

Publications

Complete list, grouped by publication year. Sifei Liu is shown in bold.

2026

12 papers

Vesta: A Generalist Embodied Reasoning Model

Johan Bjorck, Zhiqi Li, Yunze Man, Jing Wang, An-Chieh Cheng, Sifei Liu, Shihao Wang, Zhiding Yu, Abhishek Badki, Stan Birchfield, Valts Blukis, Yevgen Chebotar, Siyi Chen, Sicong Leng, Yu-Cheng Chou, Tianli Ding, Boyi Li, Zhengyi Luo, Hang Su, Jonathan Tremblay, Tingwu Wang, Bowen Wen, Jimmy Wu, Xianghui Xie, Hanrong Ye, Hongxu Yin, K. R. Zentner, Liangyan Gui, Yu-Xiong Wang, Yuke Zhu, Linxi Fan, Jan Kautz

Vesta is a powerful, state-of-the-art Robot System 2 embodied-reasoning VLM spanning localization, navigation, memory, reasoning, tool use, and long-horizon planning.

NVIDIA Technical Report, 2026

Reinforcing Dual-Path Reasoning in Spatial Vision Language Models

Yatai Ji, An-Chieh Cheng, Yang Fu, Yukang Chen, Han Zhang, Zhaojing Yang, Wei Huang, Ka Chun Cheung, Song Han, Vidya Nariyambut Murali, Pavlo Molchanov, Simon See, Jan Kautz, Hongxu Yin, Ping Luo, Sifei Liu

SR-REAL jointly reinforces language-only deduction and detect-then-reason 3D grounding for stronger spatial reasoning.

arXiv, 2026

Scaling Parallel Sequence Models to Vision Foundation Models

Yitong Jiang, Collin McCarthy, Hongjun Wang, Hanrong Ye, Qi Dou, Tianfan Xue, Jinwei Gu, Jan Kautz, Hongxu Yin, Pavlo Molchanov, Sifei Liu

Compact GSPN scales linear-time 2D spatial propagation to foundation-scale vision encoders with fused kernels and cross-operator distillation.

CVPR, 2026

Grounded 3D-Aware Spatial Vision-Language Modeling

An-Chieh Cheng, Yang Fu, Yatai Ji, Ligeng Zhu, Guanqi Zhan, Zhuoyang Zhang, Zhaojing Yang, Song Han, Yao Lu, Pavlo Molchanov, Vidya Nariyambut Murali, Jan Kautz, Xiaolong Wang, Hongxu Yin, Sifei Liu

GR3D unifies explicit 2D, implicit 2D, and monocular 3D grounding for grounded spatial chain-of-thought reasoning.

CVPR, 2026

OmniVinci: Enhancing Architecture and Data for Omni-Modal Understanding LLM

Hanrong Ye, Chao-Han Huck Yang, Arushi Goel, Wei Huang, Ligeng Zhu, Yuanhang Su, Sean Lin, An-Chieh Cheng, Zhen Wan, Jinchuan Tian, Yuming Lou, Dong Yang, Zhijian Liu, Yukang Chen, Ambrish Dantrey, Ehsan Jahangiri, Sreyan Ghosh, Daguang Xu, Ehsan Hosseini-Asl, Danial Mohseni Taheri, Vidya Nariyambut Murali, Sifei Liu, Yao Lu, Oluwatobi Olabiyi, Yu-Chiang Frank Wang, Rafael Valle, Bryan Catanzaro, Andrew Tao, Song Han, Jan Kautz, Hongxu Yin, Pavlo Molchanov

OmniVinci advances joint image, video, audio, and text understanding through cross-modal alignment and large-scale omni-modal data.

ICLR, 2026

2025

14 papers

Real Deep Research for AI, Robotics and Beyond

Xueyan Zou, Jianglong Ye, Hao Zhang, Xiaoyu Xiang, Mingyu Ding, Zhaojing Yang, Yong Jae Lee, Zhuowen Tu, Sifei Liu, Xiaolong Wang

Real Deep Research provides a generalizable pipeline for mapping research areas, identifying emerging trends, and uncovering cross-domain opportunities, with extensive analyses of AI and robotics.

arXiv, 2025

Scaling RL to Long Videos

Yukang Chen, Wei Huang, Baifeng Shi, Qinghao Hu, Hanrong Ye, Ligeng Zhu, Zhijian Liu, Pavlo Molchanov, Jan Kautz, Xiaojuan Qi, Sifei Liu, Hongxu Yin, Yao Lu, Song Han

Long-RL combines large-scale reasoning data, reinforcement learning, and sequence-parallel infrastructure for hour-long video understanding.

NeurIPS, 2025

M3: 3D-Spatial MultiModal Memory

Xueyan Zou, Yuchen Song, Ri-Zhao Qiu, Xuanbin Peng, Jianglong Ye, Sifei Liu, Xiaolong Wang

M3 stores foundation-model features in a compact 3D Gaussian memory for grounded multimodal retrieval.

ICLR, 2025

NVILA: Efficient Frontier Visual Language Models

Zhijian Liu, Ligeng Zhu, Baifeng Shi, Zhuoyang Zhang, Yuming Lou, Shang Yang, Haocheng Xi, Shiyi Cao, Yuxian Gu, Dacheng Li, Xiuyu Li, Haotian Tang, Yunhao Fang, Yukang Chen, Cheng-Yu Hsieh, De-An Huang, An-Chieh Cheng, Jinyi Hu, Sifei Liu, Ranjay Krishna, Pavlo Molchanov, Jan Kautz, Hongxu Yin, Song Han, Yao Lu

NVILA is an efficient frontier family of visual language models with strong training and inference efficiency.

CVPR, 2025

2024

14 papers

2023

3 papers

2022

5 papers

2021

11 papers

2020

3 papers

2019

6 papers

2018

5 papers

2017

5 papers

2016

2 papers

2015

1 paper

2014

1 paper

2013

1 paper