Guo Moruo Scholarship. From USTC, 2018.
Posts by Collection
awards
1st (Track 3) in the 3rd Large-scale Video Object Segmentation Challenge. CVPR 2021. [Report]
1st (Track 1) in the 3rd Large-scale Video Object Segmentation Challenge. CVPR 2021. [Report]
1st in eBay eProduct Visual Search Challenge. CVPR 2022. [Report]
1st in the VOT 2022 short-term segmentation tracking challenge. ECCV 2022. [Report]
1st in the VOT 2022 real-time segmentation tracking challenge. ECCV 2022. [Report]
1st in TREK-150 Object Tracking of EPIC-Kitchens Dataset Challenges. CVPR 2023. [Report]
1st in Semi-Supervised Video Object Segmentation of EPIC-Kitchens Dataset Challenges. CVPR 2023. [Report]
1st in the VOTS 2023 challenge. ICCV 2023. [Report]
portfolio
Portfolio item number 1
Short description of portfolio item number 1
Portfolio item number 2
Short description of portfolio item number 2 
publications
H2FA R-CNN: Holistic and Hierarchical Feature Alignment for Cross-domain Weakly Supervised Object Detection
Yunqiu Xu, Yifan Sun, Zongxin Yang, Jiaxu Miao, Yi Yang
In-N-Out Generative Learning for Dense Unsupervised Video Segmentation
Xiao Pan, Peike Li, Zongxin Yang, Huiling Zhou, Chang Zhou, Hongxia Yang, Jingren Zhou, Yi Yang
Instance As Identity: A Generic Online Paradigm for Video Instance Segmentation
Feng Zhu, Zongxin Yang, Yunchao Wei, Xin Yu, Yi Yang
Decompose to Generalize: Species-Generalized Animal Pose Estimation
Guangrui Li, Yifan Sun, Zongxin Yang, Yi Yang
ICLR 2023. [PDF]
ProD: Prompting-to-disentangle Domain Knowledge for Cross-domain Few-shot Image Classification
Tianyi Ma, Yifan Sun, Zongxin Yang, Yi Yang
CVPR 2023. [PDF]
Global-to-Local Modeling for Video-based 3D Human Pose and Shape Estimation
Xiaolong Shen, Zongxin Yang, Xiaohan Wang, Jianxin Ma, Chang Zhou, Yi Yang
FedSeg: Class-Heterogeneous Federated Learning for Semantic Segmentation
Jiaxu Miao, Zongxin Yang, Leilei Fan, Yi Yang
Co-Learning Meets Stitch-Up for Noisy Multi-Label Visual Recognition
Chao Liang, Zongxin Yang, Linchao Zhu, Yi Yang
Pyramid Diffusion Models For Low-light Image Enhancement
Dewei Zhou, Zongxin Yang, Yi Yang
Video Object Segmentation in Panoptic Wild Scenes
Yuanyou Xu, Zongxin Yang, Yi Yang
Segment and Track Anything
Yangming Cheng, Liulei Li, Yuanyou Xu, Xiaodi Li, Zongxin Yang, Wenguan Wang, Yi Yang
JOTR: 3D Joint Contrastive Learning with Transformers for Occluded Human Mesh Recovery
Jiahao Li, Zongxin Yang, Xiaohan Wang, Jianxin Ma, Chang Zhou, Yi Yang
TransHuman: A Transformer-based Human Representation for Generalizable Neural Human Rendering
Xiao Pan, Zongxin Yang, Jianxin Ma, Chang Zhou, Yi Yang
ICCV 2023. [Proj. page] [PDF] [Code]
Efficient Emotional Adaptation for Audio-driven Talking-Head Generation
Yuan Gan, Zongxin Yang, Xihang Yue, Lingyun Sun, Yi Yang
Integrating Boxes and Masks: A Multi-Object Framework for Unified Visual Tracking and Segmentation
Yuanyou Xu, Zongxin Yang, Yi Yang
Global-correlated 3D-decoupling Transformer for Clothed Avatar Reconstruction
Zechuan Zhang, Li Sun, Zongxin Yang, Lin Chen, Yi Yang
NeurIPS 2023. [Proj. page] [PDF] [Code]
AvatarFusion: Zero-shot Generation of Clothing-Decoupled 3D Avatars Using 2D Diffusion
Shuo Huang, Zongxin Yang, Liangting Li, Yi Yang, Jia Jia
ACM MM 2023. [Proj. page] [PDF] [Code]
GD-NeRF: Generative Detail Compensation for One-shot Generalizable Neural Radiance Fields
Xiao Pan, Zongxin Yang✉, Shuai Bai, Yi Yang
ACM Transactions on Multimedia Computing, Communications, and Applications 2025. [PDF]
Human101: Training 100+ FPS Human Gaussians in 100s from 1 View
Mingwei Li, Jiachen Tao, Zongxin Yang, Yi Yang
Photorealistic Text-to-3D Avatar Generation with Constrained Geometry and Appearance
Yuanyou Xu, Zongxin Yang, Yi Yang
ECCV 2024 Workshops (proceedings 2025). [Proj. page] [PDF] [Code]
SIFU: Side-view Conditioned Implicit Function for Real-world Usable Clothed Human Reconstruction
Zechuan Zhang, Zongxin Yang✉, Yi Yang
CVPR 2024 (Highlight). [Proj. page] [PDF] [Code]
HeadStudio: Text to Animatable Head Avatars with 3D Gaussian Splatting
Zhenglin Zhou, Fan Ma, Hehe Fan, Zongxin Yang, Yi Yang
DRIP: Unleashing Diffusion Priors for Joint Foreground and Alpha Prediction in Image Matting
Xiaodi Li, Zongxin Yang, Ruijie Quan, Yi Yang
Few-shot Incremental Learning via Foreground Aggregation and Knowledge Transfer for Audio-Visual Semantic Segmentation
Jingqian Xiu, Mengze Li, Zongxin Yang, Wei Ji, Yifang Yin, Roger Zimmermann
AAAI 2025.
Very Long Natural Scenery Image Prediction by Outpainting
Zongxin Yang, Jian Dong, Ping Liu, Yi Yang, Shuicheng Yan
Gated Channel Transformation for Visual Recognition
Zongxin Yang, Linchao Zhu, Yu Wu, Yi Yang
Collaborative Video Object Segmentation by Foreground-Background Integration
Zongxin Yang, Yunchao Wei, Yi Yang
DSC-PoseNet: Learning 6DoF Object Pose Estimation via Dual-scale Consistency
Zongxin Yang, Xin Yu, Yi Yang
CVPR 2021. [PDF]
Collaborative Video Object Segmentation by Multi-Scale Foreground-Background Integration
Zongxin Yang, Yunchao Wei, Yi Yang
Associating Objects with Transformers for Video Object Segmentation
Zongxin Yang, Yunchao Wei, Yi Yang
Decoupling Features in Hierarchical Propagation for Video Object Segmentation
Zongxin Yang, Yi Yang
Controllable 3D Face Generation with Conditional Style Code Diffusion
Xiaolong Shen, Jianxin Ma, Chang Zhou, Zongxin Yang✉
Scalable Video Object Segmentation with Identification Mechanism
Zongxin Yang, Jiaxu Miao, Yunchao Wei, Wenguan Wang, Xiaohan Wang, Yi Yang
DoraemonGPT: Toward Understanding Dynamic Scenes with Large Language Models (Exemplified as A Video Agent)
Zongxin Yang, Guikun Chen, Xiaodi Li, Wenguan Wang, Yi Yang
ICML 2024. [Proj. page] [PDF] [Code]
MIGC++: Advanced Multi-Instance Generation Controller for Image Synthesis
Dewei Zhou, You Li, Fan Ma, Zongxin Yang✉, Yi Yang
Streaming Video Understanding and Multi-round Interaction with Memory-enhanced Knowledge
Haomiao Xiong*, Zongxin Yang*, Jiazuo Yu, Yunzhi Zhuge, Lu Zhang, Jiawen Zhu, Huchuan Lu
3DIS: Depth-Driven Decoupled Image Synthesis for Universal Multi-Instance Generation
Dewei Zhou*, Ji Xie*, Zongxin Yang*, Yi Yang
DreamRenderer: Taming Multi-Instance Attribute Control in Large-Scale Text-to-Image Models
Dewei Zhou, Mingwei Li, Zongxin Yang, Yi Yang
The devil is in temporal token: High quality video reasoning segmentation
Sitong Gong, Yunzhi Zhuge, Lu Zhang, Zongxin Yang, Pingping Zhang, Huchuan Lu
Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion Transformer
Zechuan Zhang, Ji Xie, Yu Lu, Zongxin Yang, Yi Yang
NeurIPS 2025. [Proj. page] [PDF] [Code]
X-Field: A Physically Grounded Representation for 3D X-ray Reconstruction
Feiran Wang, Jiachen Tao, Junyi Wu, Haoxuan Wang, Bin Duan, Kai Wang, Zongxin Yang, Yan Yan
Insert Anything: Image Insertion via In-Context Editing in DiT
Wensong Song, Hong Jiang, Zongxin Yang, Ruijie Quan, Yi Yang
AAAI 2026 (Oral). [Proj. page] [PDF] [Code]
MedSAM2: Segment Anything in 3D Medical Images and Videos
Jun Ma*, Zongxin Yang*, Sumin Kim, Bihui Chen, Mohammed Baharoon, Adibvafa Fallahpour, Reza Asakereh, Hongwei Lyu, Bo Wang
A Weakly Supervised Transformer for Rare Disease Diagnosis and Subphenotyping from EHRs with Pulmonary Case Studies
Kimberly F. Greco*, Zongxin Yang*, Mengyan Li, Han Tong, Sara Morini Sweet, Alon Geva, Kenneth D. Mandl, Benjamin A. Raby, Tianxi Cai
Nature Partner Journal Digital Medicine. [PDF]
CLINES: Clinical LLM-based Information Extraction and Structuring Agent
Zongxin Yang*, Hongyi Yuan*, Raheel Sayeed*, Amelia Li Min Tan, Enci Cai, Mohammed Moro, Xiudi Li, Huaiyuan Ying, Nicholas Brown, Griffin Weber, and others
BMJ Digital Health & AI (Accepted). [PDF]
Prompt-based multimodal representation learning for drug repurposing
Jinliang Liu, Kaicheng U, Dhruv Rana, Sophia Meixuan Zhang, Jiahui Yu, Sen Yang, Bo Jin, Xiyue Wang, Zongxin Yang✉, Hongping Tang, and others
Briefings in Bioinformatics 2025. [PDF]
Beyond Independent Genes: Learning Module-Inductive Representations for Single-Cell Gene Perturbation Prediction
Jiafa Ruan, Ruijie Quan, Liyang Xu, Zongxin Yang✉, Yi Yang
ICML 2026. [PDF]
Stroke3D: Lifting 2D strokes into rigged 3D model via latent diffusion models
Ruisi Zhao, Haoren Zheng, Zongxin Yang, Hehe Fan, Yi Yang
ICLR 2026. [PDF]
BideDPO: Conditional Image Generation with Simultaneous Text and Condition Alignment
Dewei Zhou, Mingwei Li, Zongxin Yang, Yu Lu, Yunqiu Xu, Zhizhong Wang, Zeyi Huang, Yi Yang
ICLR 2026. [PDF]
Progressive Online Video Understanding with Evidence-Aligned Timing and Transparent Decisions
Kecheng Zhang, Zongxin Yang, Mingfei Han, Haihong Hao, Yunzhi Zhuge, Changlin Li, Junhan Zhao, Zhihui Li, Xiaojun Chang
ICLR 2026. [PDF]
Are Image-to-Video Models Good Zero-Shot Image Editors?
Zechuan Zhang, Zhenyuan Chen, Zongxin Yang, Yi Yang
CVPR 2026. [PDF]
SELongVLM: Empowering Long Video Language Models with Self-Corrective Clip Selection
Kecheng Zhang, Zongxin Yang, Mingfei Han, Yunzhi Zhuge, Haihong Hao, Changlin Li, Zhihui Li, Xiaojun Chang
TPAMI 2026. [PDF]
Efficient training of large vision models via advanced automated progressive learning
Changlin Li, Jiawei Zhang, Sihao Lin, Zongxin Yang, Junwei Liang, Xiaodan Liang, Xiaojun Chang
RefineAnything: Multimodal Region-Specific Refinement for Perfect Local Details
Dewei Zhou, You Li, Zongxin Yang, Yi Yang
arXiv 2026. [Proj. page] [PDF] [Code]
CATR: Combinatorial-Dependence Audio-Queried Transformer for Audio-Visual Video Segmentation
Kexin Li, Zongxin Yang✉, Lei Chen, Yi Yang, Jun Xiao
Dual Embedding Learning for Video Instance Segmentation
Qianyu Feng, Zongxin Yang, Peike Li, Yunchao Wei, Yi Yang
ICCV 2019 Workshops. [PDF]
Going Deeper Into Embedding Learning for Video Object Segmentation
Zongxin Yang, Peike Li, Qianyu Feng, Yunchao Wei, Yi Yang
ICCV 2019 Workshops. [PDF]
CFBI+: Collaborative video object segmentation by multi-scale foreground-background integration
Zongxin Yang, Yuhang Ding, Yunchao Wei, Yi Yang
CVPR 2020 DAVIS Challenge — Technical report. [PDF]
Memory aggregated cfbi+ for interactive video object segmentation
Chen Liang, Zongxin Yang, Jiaxu Miao, Yunchao Wei, Yi Yang
CVPR 2020 DAVIS Challenge — Technical report. [PDF]
Towards multi-object association from foreground-background integration
Zongxin Yang, Jian Zhang, Wenhao Wang, Wenhua Han, Yue Yu, Yingying Li, Jian Wang, Yunchao Wei, Yifan Sun, Yi Yang
CVPR 2021 YouTube-VOS Challenge — Technical report. [PDF]
Rethinking cross-modal interaction from a top-down perspective for referring video object segmentation
Chen Liang, Yu Wu, Tianfei Zhou, Wenguan Wang, Zongxin Yang, Yunchao Wei, Yi Yang
CVPR 2021 Referring YouTube-VOS Challenge — Technical report. [PDF]
V²L: Leveraging Vision and Vision-language Models into Large-scale Product Retrieval
Wenhao Wang, Yifan Sun, Zongxin Yang, Yi Yang
arXiv 2022 — Technical report. [PDF]
The Tenth Visual Object Tracking VOT2022 Challenge Results
Matej Kristan, Aleš Leonardis, Jiří Matas, et al. (including Zongxin Yang)
ECCV 2022 Workshops (proceedings 2023). [PDF]
Collaborative Content-Dependent Modeling: A Return to the Roots of Salient Object Detection
Siyu Jiao, Vidit Goel, Shant Navasardyan, Zongxin Yang, Levon Khachatryan, Yi Yang, Yunchao Wei, Yao Zhao, Humphrey Shi
IEEE Transactions on Image Processing 2023. [PDF]
Shuffled Autoregression for Motion Interpolation
Shuo Huang, Jia Jia, Zongxin Yang, Wei Wang, Haozhe Wu, Yi Yang, Junliang Xing
ICASSP 2023. [PDF]
ZJU ReLER Submission for EPIC-KITCHEN Challenge 2023: TREK-150 Single Object Tracking
Yuanyou Xu, Jiahao Li, Zongxin Yang, Yi Yang, Yueting Zhuang
CVPR 2023 EPIC-KITCHENS Challenge — Technical report. [PDF]
ZJU ReLER Submission for EPIC-KITCHEN Challenge 2023: Semi-Supervised Video Object Segmentation
Jiahao Li, Yuanyou Xu, Zongxin Yang, Yi Yang, Yueting Zhuang
CVPR 2023 EPIC-KITCHENS Challenge — Technical report. [PDF]
The First Visual Object Tracking Segmentation VOTS2023 Challenge Results
Matej Kristan, Jiří Matas, Martin Danelljan, et al. (including Zongxin Yang)
ICCV 2023 Workshops. [PDF]
High Fidelity Makeup via 2D and 3D Identity Preservation Net
Jinliang Liu, Zhedong Zheng, Zongxin Yang, Yi Yang
ACM Transactions on Multimedia Computing, Communications, and Applications 2024. [PDF]
IDPro: Flexible Interactive Video Object Segmentation by ID-Queried Concurrent Propagation
Kexin Li, Tao Jiang, Zongxin Yang, Yi Yang, Yueting Zhuang, Jun Xiao
IEEE Transactions on Circuits and Systems for Video Technology 2024. [PDF]
MuscleParseNet: A Novel Framework for Parsing Muscles of Drosophila Larva in Light-Sheet Fluorescence Microscopy Images
Zhiying Song, Pengfei Wang, Jinrun Zhou, Zongxin Yang, Yi Yang, Zhefeng Gong, Nenggan Zheng
IEEE Transactions on Circuits and Systems for Video Technology 2024. [PDF]
Noise-Tolerant Hybrid Prototypical Learning with Noisy Web Data
Chao Liang, Linchao Zhu, Zongxin Yang, Wei Chen, Yi Yang
ACM Transactions on Multimedia Computing, Communications, and Applications 2024. [PDF]
Show Me a Video: A Large-Scale Narrated Video Dataset for Coherent Story Illustration
Yu Lu, Feiyue Ni, Haofan Wang, Xiaofeng Guo, Linchao Zhu, Zongxin Yang, Ruihua Song, Lele Cheng, Yi Yang
IEEE Transactions on Multimedia 2024 (online 2023). [PDF]
3DIS-FLUX: simple and efficient multi-instance generation with DiT rendering
Dewei Zhou, Ji Xie, Zongxin Yang, Yi Yang
arXiv 2025 — Preprint. [PDF]
Exploiting EfficientSAM and Temporal Coherence for Audio-Visual Segmentation
Yue Zhu, Kun Li, Zongxin Yang
IEEE Transactions on Multimedia 2025. [PDF]
Unified Representation of Genomic and Biomedical Concepts through Multi-Task, Multi-Source Contrastive Learning
Hongyi Yuan, Suqi Liu, Zongxin Yang, Kelly Cho, Katherine P. Liao, Alexandre Pereira, Tianxi Cai
ICML 2025 FM4LS Workshop. [PDF]
SKDream: Controllable Multi-view and 3D Generation with Arbitrary Skeletons
Yuanyou Xu, Zongxin Yang, Yi Yang
CVPR 2025 (Highlight). [PDF]
Test-Time Adaptation for Real-World Video Adverse Weather Restoration With Meta Batch Normalization
Jinliang Liu, Zongxin Yang
IEEE Transactions on Circuits and Systems for Video Technology 2025. [PDF]
AI-powered medicinal chemistry and translational drug development
Kaicheng U, Sophia Meixuan Zhang, Ziyu Yu, Zechuan Zhang, Jianwei Zhang, Chang He, Anbang Liu, Rui Chen, Stella Wang, Lijie Yan, Shichao Ding, Lavonda Li, Zongxin Yang, Gao Xiao, Xushuai Zhang, Kaige Bao, Haohan Wang, Athanasios V. Vasilakos, Junhan Zhao, Siwei Chen, Xingcai Zhang
Chemical Society Reviews. [PDF]
Toward General-Purpose Video Reconstruction Through Synergy of Grid-Splicing Diffusion and Large Language Models
Jinliang Liu, Jianwei Zhang, Sen Yang, Jinxi Xiang, Xiyue Wang, Jieqiong Zhao, Zongxin Yang, Junhan Zhao
IEEE Transactions on Circuits and Systems for Video Technology 2026. [PDF]
Photorealistic Text-to-3D Avatar Generation with Constraints for Decoupled Geometry and Appearance
Yuanyou Xu, Zongxin Yang, Yi Yang
ACM Transactions on Multimedia Computing, Communications, and Applications 2026. [PDF]
Learning residue-level context for modeling protein-protein interactions
Zechuan Zhang*, Zongxin Yang*, Anbang Liu*, Kun-Hsing Yu, Junhan Zhao, Yi Yang, Benjamin Neale, Siwei Chen
Replication in Visual Diffusion Models: A Survey and Outlook
Wenhao Wang, Yifan Sun, Zongxin Yang, Zhengdong Hu, Zhentao Tan, Yi Yang
IEEE Transactions on Pattern Analysis and Machine Intelligence 2026. [PDF]
talks
Talk 1 on Relevant Topic in Your Field
Published:
This is a description of your talk, which is a markdown files that can be all markdown-ified like any other post. Yay markdown!
Conference Proceeding talk 3 on Relevant Topic in Your Field
Published:
This is a description of your conference proceedings talk, note the different field in type. You can put anything in this field.
teaching
Teaching experience 1
Undergraduate course, University 1, Department, 2014
This is a description of a teaching experience. You can use markdown like any other post.
Teaching experience 2
Workshop, University 1, Department, 2015
This is a description of a teaching experience. You can use markdown like any other post.
