📝 Publications

ECCV 2026
sym

StreamSpatial: A Benchmark and Framework for Streaming 3D Visual-Spatial Reasoning
Junlin Xie, Keyang Zhong, Quanlong Zheng, Ruifei Zhang, Kuo Wang, Yanhao Zhang, Haonan Lu, Xiang Wan, Guanbin Li
ECCV 2026

CVPR 2026
sym

EvoGraph-R1: Self-Evolving Multimodal Knowledge Hypergraphs for Agentic Retrieval
Jiashi Lin, Changhong Jiang, Xiangru Lin, Ruifei Zhang, Xinyi Zhu, Jiyao Liu, Cheng Tang, Ye Du, Shujian Gao, Junzhi Ning, Lihao Liu, Ziyan Huang, Tianbin Li, Jin Ye, Junjun He
CVPR 2026

CVPR 2026
sym

StreamRAG: Enhancing Real-Time Video Understanding with Retrieval Augmentation
Junlin Xie, Quanlong Zheng, Ruifei Zhang, Yanhao Zhang, Xiang Wan, Guanbin Li
CVPR 2026

arXiv 2025
sym

A survey on agentic multimodal large language models
Huanjin Yao, Ruifei Zhang (Equal Contribution), Jiaxing Huang, Jingyi Zhang, Yibo Wang, Bo Fang, Ruolin Zhu, Yongcheng Jing, Shunyu Liu, Guanbin Li, Dacheng Tao
arXiv 2025

NeurIPS 2025
sym

Intermediate Domain Alignment and Morphology Analogy for Patent-Product Image Retrieval
Haifan Gong, Xuanye Zhang, Ruifei Zhang, Yun Su, Zhuo Li, Yuhao Du, Anningzhe Gao, Xiang Wan, Haofeng Li
NeurIPS 2025

ICCV 2025
sym

AdaDrive: Self-Adaptive Slow-Fast System for Language-Grounded Autonomous Driving
Ruifei Zhang, Junlin Xie, Wei Zhang, Weikai Chen, Xiao Tan, Xiang Wan, Guanbin Li
ICCV 2025

ICCV 2025
sym

VLDrive: Vision-Augmented Lightweight MLLMs for Efficient Language-grounded Autonomous Driving
Ruifei Zhang, Wei Zhang, Xiao Tan, Sibei Yang, Xiang Wan, Xiaonan Luo, Guanbin Li
ICCV 2025

Visual Intelligence 2025
sym

Large Multimodal Agents: A Survey
Junlin Xie, Zhihong Chen, Ruifei Zhang, Guanbin Li
Visual Intelligence 2025

NeurIPS 2024 Spotlight
sym

WhodunitBench: Evaluating Large Multimodal Agents via Murder Mystery Games
Junlin Xie, Ruifei Zhang (Equal Contribution), Quanlong Zheng, Yanhao Zhang, Xiang Wan, Guanbin Li
NeurIPS 2024 (Spotlight)

ECCV 2024
sym

Interactive 3D Object Detection with Prompts
Ruifei Zhang, Xiangru Lin, Wei Zhang, Jincheng Lu, Xuekuan Wang, Xiao Tan, Yingying Li, Errui Ding, Jingdong Wang, Guanbin Li
ECCV 2024

CVPR 2023
sym

Advancing Visual Grounding with Scene Knowledge: Benchmark and Method
Zhihong Chen, Ruifei Zhang (Equal Contribution), Yibing Song, Xiang Wan, Guanbin Li
CVPR 2023