Qizhen Weng 翁祈桢

Large Model System Researcher. Ph.D. in CSE from HKUST.

photo_full.jpg

My research interests encompass AI Infrastructure, Machine Learning Systems, and Cloud Computing, with a particular emphasis on enhancing GPU cluster efficiency and optimizing training performance for large-scale generative models, such as large language models (LLMs), multimodal LLMs (MLLMs), and diffusion transformers (DiTs).

(1) From 2024 to May 2026, I led the AI Infrastructure Research Center at the Institute of Artificial Intelligence (TeleAI), China Telecom, where I oversaw initiatives to advance AI system capabilities. (2) Prior to this, I joined the Shanghai AI Laboratory in 2022 as a Systems Researcher, contributing to the systems for large language model training and inference. (3) Earlier, I gained valuable experience as a Research Intern at Alibaba Cloud & Alibaba Group, where I focused on GPU cluster management and AI job scheduling for over two years, beginning in 2020.

I received my Ph.D. in Computer Science and Engineering from The Hong Kong University of Science and Technology in 2022, under the guidance of Prof. Wei Wang. I also hold a B.Eng. degree from Shanghai Jiao Tong University in 2017 and enriched my academic journey with a study period at UC Berkeley in 2015.

Awards

News & Highlights

Aug 21, 2026 📜EMNLP 2026: Beyond Binary, which turns partial success into dense verifiable rewards for reinforcement learning in code generation, is accepted to EMNLP 2026! See our paper “Beyond Binary: Turning Partial Success into Dense Verifiable Rewards for Reinforcement Learning in Code Generation” for details.
Jul 02, 2026 📜SC 2026: Arachne, a training framework that orchestrates cascades for efficient text-to-video model training at scale, is accepted to SC 2026! See our paper “Arachne: Orchestrating Cascades for Efficient Text-to-Video Model Training” for details.
Apr 29, 2026 📜ICML 2026: Swift-SVD, a theoretically optimal and practically efficient method for low-rank compression of LLM weights, is accepted to ICML 2026! See our paper “Swift-SVD: Theoretical Optimality Meets Practical Efficiency in Low-Rank LLM Compression” for details.
Jan 31, 2026 📜EuroSys 2026: Suika, a cluster training system that supports efficient and high-quality rescheduling for 3D-parallelized LLM training jobs, is accepted to EuroSys 2026! See our paper “Suika: Efficient and High-quality Rescheduling of 3D-parallelized LLM Training Jobs in Shared Clusters” for details.
Aug 23, 2025 📜EuroSys 2026: GRouter, a GPU-centric data plane system designed for serverless inference workflows, is accepted to EuroSys 2026! See our paper “Efficient Data Passing for Serverless Inference Workflows: A GPU-Centric Approach” for details.
Jun 15, 2025 ♻️AI for Good Global Summit: I was invited as a keynote speaker at the AI for Good Global Summit (8–11 July 2025, Geneva, ITU). I presented “China Telecom drives ubiquitous intelligence through AI Flow”, on bridging devices, edge, and cloud for ubiquitous intelligence.

Selected Publications (Full List)

  1. EMNLP
    2026.EMNLP-BeyondBinary-Wang-preview.png
    Beyond Binary: Turning Partial Success into Dense Verifiable Rewards for Reinforcement Learning in Code Generation
    Longwen Wang, Yirui Liu, Xuan’er Wu, Xiaohui Hu, Yuankai Fan, Kaidong Yu, Qizhen Weng, Wei Xi, and Xuelong Li
    In Conference on Empirical Methods in Natural Language Processing (EMNLP), Nov 2026
  2. ICML
    2026.ICML-SwiftSVD-Qi-preview.png
    Swift-SVD: Theoretical Optimality Meets Practical Efficiency in Low-Rank LLM Compression
    Ruoling Qi, Yirui Liu, Xuaner Wu, Xiangyu Wang, Ming Li, Chen Chen, Jian Chen, Yin Chen, and Qizhen Weng
    In International Conference on Machine Learning (ICML), Jul 2026
  3. SC
    2026.SC-Arachne-Yu-preview.png
    Arachne: Orchestrating Cascades for Efficient Text-to-Video Model Training
    Peng Yu, Yuankai Fan, Yang Qiu, Tian Li, Bihuan Chen, Yin Chen, and Qizhen Weng
    In International Conference for High Performance Computing, Networking, Storage, and Analysis (SC), Nov 2026
  4. EuroSys
    2026.EuroSys-Suika-Wang-preview.png
    Suika: Efficient and High-quality Re-scheduling of 3D-parallelized LLM Training Jobs in Shared Clusters
    Yuxuan Wang, Yanbo Wang, Chen Chen, Chunyu Xue, Qizhen Weng, Yin Chen, Zeren Li, Xuqi Zhu, Yongqiang Yang, Quan Chen, and 1 more author
    In 21th ACM European Conference on Computer Systems (EuroSys), Apr 2026
  5. EuroSys
    2026.EuroSys-GRouter-Wu-preview.png
    Efficient Data Passing for Serverless Inference Workflows: A GPU-Centric Approach
    Hao Wu, Yaochen Liu, Minchen Yu, Qizhen Weng, Junxiao Deng, Yue Yu, Hao Fan, Song Wu, Wei Wang, and Hai Jin
    In 21th ACM European Conference on Computer Systems (EuroSys), Apr 2026
  6. arXiv
    2026.arXiv-TeleOmni-Liu-preview.png
    Tele-Omni: A Unified Multimodal Framework for Video Generation and Editing
    Jialun Liu, Tian Li, Xiao Cao, Yukuo Ma, Gonghu Shang, Haibin Huang, Chi Zhang, Xiangzhen Chang, Zhiyong Huang, Jiakui Hu, and 13 more authors
    arXiv preprint arXiv:2602.09609, Feb 2026
  7. arXiv
    2026.arXiv-TeleBoost-Liang-preview.png
    TeleBoost: A Systematic Alignment Framework for High-Fidelity, Controllable, and Robust Video Generation
    Yuanzhi Liang, Xuan’er Wu, Yirui Liu, Yijie Fang, Yizhen Fan, Ke Hao, Rui Li, Ruiying Liu, Ziqi Ni, Peng Yu, and 5 more authors
    Feb 2026
  8. arXiv
    2025.arXiv-TeleWorld-Chen-preview.png
    TeleWorld: Towards Dynamic Multimodal Synthesis with a 4D World Model
    Yabo Chen, Yuanzhi Liang, Jiepeng Wang, Tingxi Chen, Junfei Cheng, Zixiao Gu, Yuyang Huang, Zicheng Jiang, Wei Li, Tian Li, and 17 more authors
    arXiv preprint arXiv:2601.00051, Dec 2025
    Ranked No. 1 on the WorldScore Leaderboard in December 2025
  9. arXiv
    2025.arXiv-AITrinity-Fan-preview.png
    Computation-Bandwidth-Memory Trade-offs: A Unified Paradigm for AI Infrastructure
    Yuankai Fan, Qizhen Weng, and Xuelong Li
    arXiv preprint arXiv:2601.11577, Dec 2025
  10. ATC
    2025.ATC-Toppings-Li-preview.png
    Toppings: CPU-Assisted, Rank-Aware Adapter Serving for LLM Inference
    Suyi Li, Hanfeng Lu, Tianyuan Wu, Minchen Yu, Qizhen Weng, Xusheng Chen, Yizhou Shan, Binhang Yuan, and Wei Wang
    In 2025 USENIX Annual Technical Conference (ATC), Jul 2025
  11. NSDI
    2025.NSDI-Prism-Yang-preview.png
    GPU-Disaggregated Serving for Deep Learning Recommendation Models at Scale
    Lingyun Yang, Yongchen Wang, Yinghao Yu, Qizhen Weng, Jianbo Dong, Kan Liu, Chi Zhang, Yanyi Zi, Hao Li, Zechao Zhang, and 12 more authors
    In 22nd USENIX Symposium on Networked Systems Design and Implementation (NSDI), Apr 2025
  12. arXiv
    2024.arXiv-LLM Survey-Duan-preview.png
    Efficient Training of Large Language Models on Distributed Infrastructures: A Survey
    Jiangfei Duan, Shuo Zhang, Zerui Wang, Lijuan Jiang, Wenwen Qu, Qinghao Hu, Guoteng Wang, Qizhen Weng, Hang Yan, Xingcheng Zhang, and 6 more authors
    arXiv preprint arXiv:2407.20018, Jul 2024
  13. arXiv
    2024.arXiv-InternLM2-Cai-preview.svg
    InternLM2 Technical Report
    Zheng Cai, Maosong Cao, Haojiong Chen, Kai Chen, Keyu Chen, Xin Chen, Xun Chen, Zehui Chen, Zhi Chen, Pei Chu, and 90 more authors
    arXiv preprint arXiv:2403.17297, 2024
  14. ATC
    2023.ATC-FGD-Weng-preview.png
    Beware of Fragmentation: Scheduling GPU-Sharing Workloads with Fragmentation Gradient Descent
    Qizhen Weng, Lingyun Yang, Yinghao Yu, Wei Wang, Xiaochuan Tang, Guodong Yang, and Liping Zhang
    In 2023 USENIX Annual Technical Conference (ATC), 2023
  15. NSDI
    2022.NSDI-MLaaS-Weng-preview.png
    MLaaS in the Wild: Workload Analysis and Scheduling in Large-Scale Heterogeneous GPU Clusters
    Qizhen Weng, Wencong Xiao, Yinghao Yu, Wei Wang, Cheng Wang, Jian He, Yong Li, Liping Zhang, Wei Lin, and Yu Ding
    In 19th USENIX Symposium on Networked Systems Design and Implementation (NSDI), 2022
  16. SC
    2020.SC-Metis-Wang_Weng-preview.png
    Metis: Learning to Schedule Long-Running Applications in Shared Container Clusters at Scale
    Luping Wang, Qizhen Weng, Wei Wang, Chen Chen, and Bo Li
    In International Conference for High Performance Computing, Networking, Storage and Analysis (SC), 2020
  17. SoCC
    2020.SoCC-LBBSP-Chen-preview.png
    Semi-Dynamic Load Balancing: Efficient Distributed Learning in Non-Dedicated Environments
    Chen Chen, Qizhen Weng, Wei Wang, Baochun Li, and Bo Li
    In 11th ACM Symposium on Cloud Computing (SoCC), 2020