Hi-Guard
Policy-aligned reasoning for trustworthy multimodal moderation.
Hi-Guard addresses fine-grained multimodal moderation by explicitly modeling safety policies as structured reasoning paths and hierarchical label spaces.
The project introduces a coarse-to-fine risk decision process and path-level reinforcement learning with semantic-distance-aware rewards, improving consistency and interpretability for complex multimodal risk samples.
- Paper: arXiv:2508.03296
- Code: lianqi1008/Hi-Guard