OpenGVLab/PIIP-LLaVA_ConvNeXt-B_CLIP-L_1024-336_7B
模型介绍
文件和版本
Pull Requests
讨论
分析

本仓库包含基于 vicuna-7b-v1.5 的 PIIP-LLaVA_ConvNeXt-B_CLIP-L_1024-336_7B 模型。

有关项目介绍与使用方法,请参阅我们的 论文 和 GitHub 仓库。

引用

如果你在研究中认为本项目有帮助,请考虑引用:

@article{piip,
  title={Parameter-Inverted Image Pyramid Networks},
  author={Zhu, Xizhou and Yang, Xue and Wang, Zhaokai and Li, Hao and Dou, Wenhan and Ge, Junqi and Lu, Lewei and Qiao, Yu and Dai, Jifeng},
  journal={arXiv preprint arXiv:2406.04330},
  year={2024}
}

@article{piip_v2,
  title={Parameter-Inverted Image Pyramid Networks for Visual Perception and Multimodal Understanding},
  author={Wang, Zhaokai and Zhu, Xizhou and Yang, Xue and Luo, Gen and Li, Hao and Tian, Changyao and Dou, Wenhan and Ge, Junqi and Lu, Lewei and Qiao, Yu and Dai, Jifeng},
  journal={arXiv preprint arXiv:2501.07783},
  year={2025}
}