Publications

Publications and preprints.

2026

  1. KDD
    hi-guard-architecture.jpg
    Towards Trustworthy Multimodal Moderation via Policy-Aligned Reasoning and Hierarchical Labeling
    Anqi Li, Wenwei Jin, Jintao Tong, Pengda Qin, Weijia Li, and Guo Lu
    In Proceedings of the ACM SIGKDD Conference on Knowledge Discovery and Data Mining, 2026
    TL;DR: A policy-aligned reasoning framework with hierarchical labeling that makes multimodal content moderation transparent and trustworthy.
  2. Unified Spatiotemporal Token Compression for Video-LLMs at Ultra-Low Retention
    Junhao Du, Jialong Xue, Anqi Li, Jincheng Dai, and Guo Lu
    In IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2026
    TL;DR: Unifies spatiotemporal pruning and clustering so Video-LLMs stay accurate while keeping only a few percent of visual tokens.
  3. KDD
    uninote-framework.jpg
    UniNote: A Unified Embedding Model for Multimodal Representation and Ranking
    Jinghan Zhao, Wenwei Jin, Anqi Li, Jintao Tong, Luya Mo, Jiawei Li, Bin Li, and Yao Hu
    In ACM SIGKDD Conference on Knowledge Discovery and Data Mining, 2026
    TL;DR: A unified multimodal embedding model with contrastive SFT and RL-based ranking refinement, deployed for industrial item-to-item retrieval at Xiaohongshu.
  4. PR
    mcm-framework.jpg
    You Can Mask More For Extremely Low-Bitrate Image Compression
    Anqi Li, Feng Li, Jiaxin Han, Huihui Bai, Runmin Cong, Chunjie Zhang, Meng Wang, Weisi Lin, and Yao Zhao
    Pattern Recognition, 2026
    TL;DR: Masks more of the image than prior methods and lets a learned model inpaint it back, pushing image compression to extremely low bitrates.

2025

  1. Once-for-All: Controllable Generative Image Compression with Dynamic Granularity Adaptation
    Anqi Li, Feng Li, Yuxi Liu, Runmin Cong, Yao Zhao, and Huihui Bai
    In International Conference on Learning Representations, 2025
    TL;DR: One generative codec that adapts compression granularity on the fly, covering a wide range of bitrates with a single model.
  2. FlowCut: Rethinking Redundancy via Information Flow for Efficient Vision-Language Models
    Jintao Tong, Wenwei Jin, Pengda Qin, Anqi Li, Yixiong Zou, Yuhong Li, Yuhua Li, and Ruixuan Li
    In Advances in Neural Information Processing Systems, 2025
    TL;DR: Rethinks visual token redundancy through information flow and cuts tokens where information stops flowing, accelerating VLMs with minimal accuracy loss.

† Corresponding author.