Email: jiangyi0425 [at] gmail.com · jiangyi.enjoy [at] bytedance.com
Biography
I am a Research Lead at ByteDance Seed, where I work on generative foundation models.
I received my master's degree from the Department of Computer Science and Engineering at Zhejiang University.
Our work on Visual Autoregressive Modeling (VAR) received a NeurIPS 2024 Best Paper Award.
Research Interests
Visual foundation models, generative pretraining, and large language models.
Unified multimodal generation and understanding for open-world interaction.
Large-scale multimodal pretraining and alignment.
Invited Talks
"Elucidating the Design Space of Visual Autoregressive Models and Image Tokenizers", Tutorial: Autoregressive Models Beyond Language, NeurIPS, 2025.
"Towards Autoregressive Modeling for Scalable and Versatile Visual Generation", Workshop: What Makes a Good Video: Next Practices in Video Generation and Evaluation, NeurIPS, 2025.
"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction", invited talk at the BAAI Conference, 2024.
"Spark from Large Language Models: Pretraining, Open-World, Generalized Vision Models", invited talk at IDEA, 2024.
Highlights
Visual Autoregressive Modeling (VAR): an image generation framework based on next-scale prediction that demonstrates scaling laws and outperforms diffusion transformers on the ImageNet benchmarks evaluated in the paper.
Waver: a foundation model for unified image and video generation, supporting text-to-image, text-to-video, and image-to-video generation.
Liquid: a scalable autoregressive multimodal model with a shared vocabulary for images and text, enabling visual understanding and generation.
UniTok: a unified tokenizer for visual generation and understanding that integrates into multimodal large language models (MLLMs) to enable visual generation while preserving understanding capabilities.
ByteTrack ranked 1st among ECCV 2022 papers in Paper Digest's influence ranking. Code is available on GitHub.
Sparse R-CNN was accepted at CVPR 2021 and has implementations in widely used frameworks, including Detectron2, MMDetection, and PaddlePaddle.
Selected Publications [Google Scholar]
(* Equal contribution; † Project lead; ‡ Corresponding author)
-
Waver: Wave Your Way to Lifelike Video Generation
Yifu Zhang, Hao Yang, Yuqi Zhang, Yifei Hu, Fengda Zhu, Chuang Lin, Xiaofeng Mei, Yi Jiang, Bingyue Peng, Zehuan Yuan
arXiv:2508.15761, 2025.
I lead the team developing and launching Waver, a foundation model for text-to-image (T2I), text-to-video (T2V), and image-to-video (I2V) generation.
PDF Code -
UniTok: A Unified Tokenizer for Visual Generation and Understanding
Chuofan Ma, Yi Jiang†, Junfeng Wu, Jihan Yang, Xin Yu, Zehuan Yuan, Bingyue Peng, Xiaojuan Qi†
Advances in Neural Information Processing Systems (NeurIPS), 2025 Spotlight.
PDF Project Code -
InfinityStar: Unified Spacetime AutoRegressive Modeling for Visual Generation
Jinlai Liu*, Jian Han*, Bin Yan*, Hui Wu, Fengda Zhu, Xing Wang, Yi Jiang, Bingyue Peng, Zehuan Yuan
Advances in Neural Information Processing Systems (NeurIPS), 2025 Oral.
PDF Code -
Liquid: Language Models are Scalable and Unified Multi-modal Generators
Junfeng Wu, Yi Jiang†, Chuofan Ma, Yuliang Liu, Hengshuang Zhao, Zehuan Yuan, Song Bai, Xiang Bai
International Journal of Computer Vision (IJCV), 2025.
PDF Project Code -
Infinity: Scaling Bitwise AutoRegressive Modeling for High-Resolution Image Synthesis
Jian Han*, Jinlai Liu*, Yi Jiang*, Bin Yan, Yuqi Zhang, Zehuan Yuan, Bingyue Peng, Xiaobing Liu
IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2025 Oral.
PDF Project Code -
Goku: Flow Based Video Generative Foundation Models
Shoufa Chen, Chongjian Ge, Yuqi Zhang, Yida Zhang, Fengda Zhu, Hao Yang, Hongxiang Hao, Hui Wu, Zhichao Lai, Yifei Hu, Ting-Che Lin, Shilong Zhang, Fu Li, Chuan Li, Xing Wang, Yanghua Peng, Peize Sun, Ping Luo, Yi Jiang, Zehuan Yuan, Bingyue Peng, Xiaobing Liu
IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2025 Highlight.
PDF -
TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation
Liao Qu*, Huichao Zhang*, Yiheng Liu, Xu Wang, Yi Jiang, Yiming Gao, Hu Ye, Daniel K. Du, Zehuan Yuan, Xinglong Wu
IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2025.
PDF Project Code -
Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction
Keyu Tian, Yi Jiang†, Zehuan Yuan, Bingyue Peng, Liwei Wang
Advances in Neural Information Processing Systems (NeurIPS), 2024. Best Paper Award.
VAR uses next-scale prediction for image generation, demonstrates scaling laws, and outperforms diffusion transformers on the ImageNet benchmarks
I led the development of VAR from initial concept to implementation.
PDF Project Report Code -
OmniTokenizer: A Joint Image-Video Tokenizer for Visual Generation
Junke Wang, Yi Jiang†, Zehuan Yuan, Bingyue Peng, Zuxuan Wu, Yu-Gang Jiang
Advances in Neural Information Processing Systems (NeurIPS), 2024.
PDF Project Code -
Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation
Peize Sun, Yi Jiang†, Shoufa Chen, Shilong Zhang, Bingyue Peng, Ping Luo, Zehuan Yuan
arXiv:2406.06525, 2024.
Vanilla autoregressive models achieve state-of-the-art image generation performance.
PDF Project Code -
Groma: Localized Visual Tokenization for Grounding Multimodal Large Language Models
Chuofan Ma, Yi Jiang‡, Jiannan Wu, Zehuan Yuan, Xiaojuan Qi
European Conference on Computer Vision (ECCV), 2024.
A multimodal large language model (MLLM) with grounded, fine-grained visual perception capabilities.
PDF Project Code -
General Object Foundation Model for Images and Videos at Scale
Junfeng Wu*, Yi Jiang*, Qihao Liu, Zehuan Yuan, Xiang Bai, Song Bai
IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2024 Highlight.
An object-level foundation model for locating and identifying objects in images and videos.
PDF Project Code -
Generative Region-Language Pretraining for Open-Ended Object Detection
Chuang Lin, Yi Jiang‡, Lizhen Qu, Zehuan Yuan, Jianfei Cai
IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2024.
PDF Code -
CoDet: Co-Occurrence Guided Region-Word Alignment for Open-Vocabulary Object Detection
Chuofan Ma, Yi Jiang‡, Xin Wen, Zehuan Yuan, Xiaojuan Qi
Advances in Neural Information Processing Systems (NeurIPS), 2023.
PDF Project Code -
UniRef++: Segment Every Reference Object in Spatial and Temporal Spaces
Jiannan Wu, Yi Jiang, Bin Yan, Huchuan Lu, Zehuan Yuan, Ping Luo
arXiv:2312.15715, 2023. Extended version of UniRef (ICCV 2023).
PDF Code -
Segment Every Reference Object in Spatial and Temporal Spaces
Jiannan Wu, Yi Jiang, Bin Yan, Huchuan Lu, Zehuan Yuan, Ping Luo
International Conference on Computer Vision (ICCV), 2023.
PDF Code -
EGC: Image Generation and Classification via a Diffusion Energy-Based Model
Qiushan Guo, Chuofan Ma, Yi Jiang, Zehuan Yuan, Yizhou Yu, Ping Luo
International Conference on Computer Vision (ICCV), 2023.
PDF Project Code -
UNINEXT: Universal Instance Perception as Object Discovery and Retrieval
Bin Yan, Yi Jiang‡, Jiannan Wu, Dong Wang, Ping Luo, Zehuan Yuan, Huchuan Lu
IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2023.
UNINEXT unifies 10 instance perception tasks in a single model with shared parameters.
PDF Code -
InstMove: Instance Motion for Object-centric Video Segmentation
Qihao Liu*, Junfeng Wu*, Yi Jiang, Xiang Bai, Alan Yuille, Song Bai
IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2023.
PDF Code -
SparK: Designing BERT for Convolutional Networks: Sparse and Hierarchical Masked Modeling
Keyu Tian, Yi Jiang‡, Qishuai Diao, Chen Lin, Liwei Wang, Zehuan Yuan
International Conference on Learning Representations (ICLR), 2023 Spotlight (top 25% of accepted papers).
SparK extends BERT/MAE-style masked pretraining to convolutional networks.
PDF Code -
Learning Object-Language Alignments for Open-Vocabulary Object Detection
Chuang Lin, Peize Sun, Yi Jiang, Ping Luo, Lizhen Qu, Gholamreza Haffari, Zehuan Yuan, Jianfei Cai
International Conference on Learning Representations (ICLR), 2023.
PDF Code -
Rethinking Resolution in the Context of Efficient Video Recognition
Chuofan Ma, Qiushan Guo, Yi Jiang‡, Zehuan Yuan, Ping Luo, Xiaojuan Qi
Advances in Neural Information Processing Systems (NeurIPS), 2022.
PDF Code -
Unicorn: Towards Grand Unification of Object Tracking
Bin Yan, Yi Jiang‡, Peize Sun, Dong Wang, Zehuan Yuan, Ping Luo, Huchuan Lu
European Conference on Computer Vision (ECCV), 2022 Oral (top 2.7%).
Unicorn unifies multiple object tracking tasks with a shared network architecture and learning paradigm.
PDF Code -
In Defense of Online Models for Video Instance Segmentation
Junfeng Wu, Qihao Liu, Yi Jiang, Song Bai, Alan Yuille, Xiang Bai
European Conference on Computer Vision (ECCV), 2022 Oral (top 2.7%).
PDF Code -
SeqFormer: Sequential Transformer for Video Instance Segmentation
Junfeng Wu, Yi Jiang, Song Bai, Wenqing Zhang, Xiang Bai
European Conference on Computer Vision (ECCV), 2022 Oral (top 2.7%).
PDF Code -
Multimodal Transformer with Variable-length Memory for Vision-and-Language Navigation
Chuang Lin, Yi Jiang, Jianfei Cai, Lizhen Qu, Gholamreza Haffari, Zehuan Yuan
European Conference on Computer Vision (ECCV), 2022.
PDF Code -
ByteTrack: Multi-Object Tracking by Associating Every Detection Box
Yifu Zhang, Peize Sun, Yi Jiang, Dongdong Yu, Fucheng Weng, Zehuan Yuan, Ping Luo, Wenyu Liu, Xinggang Wang
European Conference on Computer Vision (ECCV), 2022.
ByteTrack ranked 1st among ECCV 2022 papers in Paper Digest's influence ranking.
PDF Code -
Language as Queries for Referring Video Object Segmentation
Jiannan Wu, Yi Jiang, Peize Sun, Zehuan Yuan, Ping Luo
IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2022.
PDF Code -
DanceTrack: Multi-Object Tracking in Uniform Appearance and Diverse Motion
Peize Sun, Jinkun Cao, Yi Jiang, Zehuan Yuan, Song Bai, Kris Kitani, Ping Luo
IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2022.
PDF Code -
MetaFormer: A Unified Meta Framework for Fine-Grained Recognition
Qishuai Diao, Yi Jiang, Bin Wen, Jia Sun, Zehuan Yuan
arXiv:2203.02751, 2022.
PDF Code -
What Makes for End-to-End Object Detection?
Peize Sun, Yi Jiang, Enze Xie, Wenqi Shao, Zehuan Yuan, Changhu Wang, Ping Luo
International Conference on Machine Learning (ICML), 2021.
PDF Code -
Sparse R-CNN: End-to-End Object Detection with Learnable Proposals
Peize Sun*, Rufeng Zhang*, Yi Jiang*, Tao Kong, Chenfeng Xu, Wei Zhan, Masayoshi Tomizuka, Lei Li, Zehuan Yuan, Changhu Wang, Ping Luo
IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2021. IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), 2023.
Sparse R-CNN has implementations in widely used frameworks, including Detectron2, MMDetection, and PaddlePaddle.
PDF Code -
TransTrack: Multiple Object Tracking with Transformer
Peize Sun, Jinkun Cao, Yi Jiang, Rufeng Zhang, Enze Xie, Zehuan Yuan, Changhu Wang, Ping Luo
arXiv:2012.15460, 2020 (revised 2021).
PDF Code -
Learning to Segment the Tail
Xinting Hu, Yi Jiang, Kaihua Tang, Jingyuan Chen, Chunyan Miao, Hanwang Zhang
IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2020.
PDF Code -
SimpleDet: A Simple and Versatile Distributed Framework for Object Detection and Instance Recognition
Yuntao Chen, Chenxia Han, Yanghao Li, Zehao Huang, Yi Jiang, Naiyan Wang, Zhaoxiang Zhang
Journal of Machine Learning Research (JMLR), 2019.
PDF Code
Honors and Awards
-
Outstanding Staff Award, ByteDance, 2020 and 2024
Competitions
-
Winner of the CVPR 2022 Large-Scale Video Object Segmentation Challenge: Video Instance Segmentation
-
Runner-up in CVPR 2021 FGVC8 iNaturalist Challenge
-
Runner-up in ICCV 2019 WIDER Face and Person Challenge: Face Detection
-
Kaggle Competitions Master, 2018
Professional Activities
-
Conference Reviewer: CVPR, ICCV, ECCV, ICLR, ICML, NeurIPS, ACM MM
-
Journal Reviewer: TPAMI, TIP, PR, TMM
-
Workshop Organizer: ECCV 2022 Workshop: Multiple Object Tracking and Segmentation in Complex Environments