# LLaVA

> Open-source visual instruction tuning model

- Category: [Multimodal & Perception](https://ailandscape.org/category/multimodal-perception) › Vision-Language Models
- Homepage: https://llava-vl.github.io
- Repository: https://github.com/haotian-liu/LLaVA
- Tags: multimodal, vision, oss
- Added to the landscape: 2026-03-18

## Similar tools in Vision-Language Models

- [Flamingo](https://ailandscape.org/tool/flamingo): DeepMind's visual language model
- [Gemini Pro Vision](https://ailandscape.org/tool/gemini-pro-vision): Google's multimodal model with vision capabilities
- [GPT-4o](https://ailandscape.org/tool/gpt-4o): OpenAI's omni model with audio, vision, and text capabilities
- [GPT-4V](https://ailandscape.org/tool/gpt-4v): OpenAI's vision-capable language model
- [InternVL 2](https://ailandscape.org/tool/internvl-2): Strong open-source vision-language model by Shanghai AI Lab
- [Qwen-VL](https://ailandscape.org/tool/qwen-vl): Alibaba's visual language model with strong document understanding
- [Reka Core](https://ailandscape.org/tool/reka-core): Reka's multimodal model handling text, images, video, and audio

---

Part of [AI Landscape](https://ailandscape.org), an open map of the AI ecosystem. Web page: https://ailandscape.org/tool/llava · Index for AI assistants: https://ailandscape.org/llms.txt
