# InternVL 2

> Strong open-source vision-language model by Shanghai AI Lab

- Category: [Multimodal & Perception](https://ailandscape.org/category/multimodal-perception) › Vision-Language Models
- Homepage: https://internvl.github.io
- Repository: https://github.com/OpenGVLab/InternVL
- Tags: multimodal, vision, open-weights
- Added to the landscape: 2026-03-18

## Similar tools in Vision-Language Models

- [Flamingo](https://ailandscape.org/tool/flamingo): DeepMind's visual language model
- [Gemini Pro Vision](https://ailandscape.org/tool/gemini-pro-vision): Google's multimodal model with vision capabilities
- [GPT-4o](https://ailandscape.org/tool/gpt-4o): OpenAI's omni model with audio, vision, and text capabilities
- [GPT-4V](https://ailandscape.org/tool/gpt-4v): OpenAI's vision-capable language model
- [LLaVA](https://ailandscape.org/tool/llava): Open-source visual instruction tuning model
- [Qwen-VL](https://ailandscape.org/tool/qwen-vl): Alibaba's visual language model with strong document understanding
- [Reka Core](https://ailandscape.org/tool/reka-core): Reka's multimodal model handling text, images, video, and audio

---

Part of [AI Landscape](https://ailandscape.org), an open map of the AI ecosystem. Web page: https://ailandscape.org/tool/internvl-2 · Index for AI assistants: https://ailandscape.org/llms.txt
