VLM(视觉语言模型)
VLM
拥有「看」的能力的语言模型。给它一张照片,它就能读懂并描述内容。
简单来说
VLM(Vision Language Model,视觉语言模型)是拥有「看」的能力的语言模型。输入照片、图片或文档,它就能读懂其中内容,用文字加以描述,并回答相关问题。
如果说只懂文字的语言模型(LLM)是一位只会笔谈的对话对象,那么VLM就是一位长了眼睛的对话对象。它能理解整份带图表的报告,读懂截图里的错误信息,还能从冰箱照片里认出食材。
可以把VLM理解为「多模态」这把大伞下专注于「视觉+语言」的一个分支。最近也经常出现用于机器人、自动驾驶的衍生模型——也就是能理解摄像头所见并转化为行动的模型(VLA)。以后在文章里看到VLM,直接把它理解成「能看懂图像的AI大脑」就行。
在报道中是这样出现的
「新款VLM登顶图表·文档理解基准测试」——能多准确地读懂表格、图表、手写字这类「难啃的画面」,正是VLM竞争的主战场。
亲手试一试
- 从新闻或报告中截取一张带有图表的画面。
- 把它上传给聊天机器人,这样提问:「说明这张图表中第一名和第三名的差距,并用一句话说说如果这个趋势持续下去会怎样」。
- 把文字、柱状、坐标轴放在一起阅读并进行推理——这种超越单纯图片描述的「视觉理解」,正是VLM的真本事。也可以拿手写笔记或复杂表格来试试看。
相关词条
出现过这个词的报道
目前还没有报道用到这个词。有新报道时会自动出现在这里。