VLM
概念词 📚 基础词库 · 存量热词视觉语言模型
🔍 Google 联想 10 📅 首次出现 2026-08-28
🧠 VLM 是什么
视觉语言模型(Vision-Language Model,VLM)指能同时处理图像与文本输入的多模态模型,可完成看图问答、图像描述、OCR、图表理解等任务,是 AI 感知世界的关键能力。
代表模型包括 GPT-4V/4o、Gemini、Qwen-VL、LLaVA 等;LLaVA 论文提出的视觉指令微调范式,推动了开源 VLM 的爆发。
VLM 是 computer use、图像智能体、文档理解等应用的基石,尺寸从几十亿到千亿级,并涌现出大量小参数高效模型。
🔥 为什么现在火
多模态是模型竞争的下一落点,主流旗舰模型全部原生支持视觉,VLM 相关评测与开源模型数量在 2024 年后快速增长。
📄 证据链(交叉验证)
🔍 搜索形态
what is vlm vlm models vlm vs llm
VLM 常见问题 FAQ
VLM 和 LLM 有什么区别?+
LLM 只处理文本,VLM 额外能理解图像输入,是在语言模型基础上加入视觉编码器与对齐训练的多模态模型。
VLM 有哪些应用?+
看图问答、OCR 文档解析、图像检索、GUI 操作智能体(computer use)、自动驾驶感知等。
与 VLM 相关的搜索
人们搜索 VLM 时,还会关心这些问题:
- VLM 是什么
- 什么是 VLM
- VLM 是什么意思
- VLM 原理
- VLM 有什么用
- VLM 应用场景
- VLM 为什么火
- VLM 2026