AI 新词情报站 — 追踪 AI 领域新概念与新工具,每个词条都有论文、代码、社区讨论构成的交叉验证证据链

VLM

概念词 📚 基础词库 · 存量热词

视觉语言模型

🔍 Google 联想 10 📅 首次出现 2026-08-28

🧠 VLM 是什么

视觉语言模型(Vision-Language Model,VLM)指能同时处理图像与文本输入的多模态模型,可完成看图问答、图像描述、OCR、图表理解等任务,是 AI 感知世界的关键能力。

代表模型包括 GPT-4V/4o、Gemini、Qwen-VL、LLaVA 等;LLaVA 论文提出的视觉指令微调范式,推动了开源 VLM 的爆发。

VLM 是 computer use、图像智能体、文档理解等应用的基石,尺寸从几十亿到千亿级,并涌现出大量小参数高效模型。

🔥 为什么现在火

多模态是模型竞争的下一落点,主流旗舰模型全部原生支持视觉,VLM 相关评测与开源模型数量在 2024 年后快速增长。

📄 证据链(交叉验证)

🔍 搜索形态

what is vlm vlm models vlm vs llm

VLM 常见问题 FAQ

VLM 和 LLM 有什么区别?+

LLM 只处理文本,VLM 额外能理解图像输入,是在语言模型基础上加入视觉编码器与对齐训练的多模态模型。

VLM 有哪些应用?+

看图问答、OCR 文档解析、图像检索、GUI 操作智能体(computer use)、自动驾驶感知等。

与 VLM 相关的搜索

人们搜索 VLM 时,还会关心这些问题:

  • VLM 是什么
  • 什么是 VLM
  • VLM 是什么意思
  • VLM 原理
  • VLM 有什么用
  • VLM 应用场景
  • VLM 为什么火
  • VLM 2026

更多概念词:同类新词