Hyper3-CLIP is a hierarchy-conditioned hyperbolic vision-language model that combines query-conditioned visual pooling with hyperbolic entailment objectives; query-conditioned pooling is active only during training, so at inference the model is a standard dual encoder and adds no extra computation.
- Matin Mahmood, hyper3labs, Berlin, Germany
- Antonio Rueda-Toicen, Hasso Plattner Institute, University of Potsdam, Germany
- Mohamed ElBassat, Faculty of Computers and Data Science, Alexandria University, Egypt
- Seifeldin Elkerdany, Faculty of Computer Science and Engineering, Alamein International University, Egypt
- Weixing Wang, Hasso Plattner Institute, University of Potsdam, Germany
- Gerard de Melo, Hasso Plattner Institute, University of Potsdam, Germany
Code and pretrained models coming soon.
Coming soon.
The model is available on HuggingFace: https://huggingface.co/hyper3labs/hyper3-clip
@inproceedings{mahmood2026hyper3clip,
title = {Hyper3-CLIP: Hierarchy-Conditioned Hyperbolic Vision-Language Training},
author = {Mahmood, Matin and Rueda-Toicen, Antonio and ElBassat, Mohamed and Elkerdany, Seifeldin and Wang, Weixing and de Melo, Gerard},
year = {2026}
}