中文

I work on video reasoning and the evaluation of vision-language models. I build benchmarks and run large-scale experiments to measure how these models reason about the visual world—and where they fail.

I'm also interested in Physical AI, world models, and making AI more trustworthy and interpretable. I'm part of VBVR-Pro, VBVR, and Grow AI.

Selected Publications

* equal contribution  ·  † equal advising  ·  ✉ corresponding author  ·  ✓ accepted

Demystifying Video Reasoning

ECCV 2026

🤗 Hugging Face #2 Paper of the Month · March 2026

Ruisi Wang, Zhongang Cai✉, Fanyi Pu, Junxiang Xu, Wanqi Yin, Maijunxian Wang, Ran Ji, Chenyang Gu, Bo Li, Ziqi Huang, Hokin Deng, Dahua Lin, Ziwei Liu, Lei Yang

arXiv·Homepage

Vision Language Models Cannot Reason About Physical Transformation (ConservationBench)

ICML 2026

Dezhi Luo*✉, Yijiang Li*✉, Maijunxian Wang, Tianwei Zhao, Bingyang Wang, Siheng Wang, Pinyuan Feng, Pooyan Rahmanzadehgervi, Ziqiao Ma, Hokin Deng

arXiv

Egocentric Bias in Vision-Language Models (FlipSet)

CogSci 2026

🏆 Sayan Gul Award · CogSci 2026
(Best Undergraduate Student Paper)

Maijunxian Wang*✉, Yijiang Li*, Bingyang Wang, Tianwei Zhao, Ran Ji, Qingying Gao†, Emmy Liu†, Hokin Deng†, Dezhi Luo✉

arXiv

Assessing Perceptual Metacognition in Vision-Language Models

CogSci 2026

Ran Ji*✉, Maijunxian Wang*, Qingying Gao, Yijiang Li, Hokin Deng, Dezhi Luo✉

Increasing Computation Resolves Conflicts in Vision Language Models

MMRAgI @ CVPR 2026

Bingyang Wang*✉, Yijiang Li*✉, Yitong Qiao, Maijunxian Wang, Tianwei Zhao, Yucheng Sun, Binyue Deng, Hokin Deng, Nuno Vasconcelos, Dezhi Luo✉

arXiv

Probing Perceptual Constancy in Large Vision-Language Models

ES-Reasoning @ ICLR 2026

Haoran Sun✉, Bingyang Wang, Suyang Yu, Yijiang Li, Qingying Gao, Haiyun Lyu, Lianyu Huang, Zelong Hong, Jiahui Ge, Qianli Ma, Hang He, Yifan Zhou, Lingzi Guo, Lantao Mei, Maijunxian Wang, Dezhi Luo, Hokin Deng

arXiv

AGI as Second Being: The Structural-Generative Ontology of Intelligence

Preprint
“True intelligence exists only when a system can generate new structures, coordinate them into reasons, and sustain its identity over time.”

Maijunxian Wang, Ran Ji

arXiv

Research Interests

Video reasoning Vision-language models Benchmarks & evaluation Physical AI World models Interpretability AI safety