K-文化的一切——从回归到 K-美妆,发送到您的邮箱订阅邮件

METAL MEDIA

K-文化术语词典使用中会遇到的词

多模态

Multimodal

不仅能理解文字,还能同时理解和生成图像、声音、视频的能力。

简单来说

模态(modality)指信息呈现的形式——文字、图像、声音、视频。多模态就是指一个模型能同时处理这几种形式。

早期的语言模型只能读文字、写文字,就像一个没有眼睛和耳朵、只能靠书信交流的笔友。多模态模型可以看懂一张照片里的内容,听懂说话并用语音回应,还能理解夹杂着表格和图表的文档。

如今的主力模型(最新版GPT、ClaudeGemini)默认都是多模态的。这也是为什么「拍一张冰箱照片就能获得菜谱推荐」成为可能,也是新模型发布时「语音对话」「屏幕理解」演示必不可少的原因。

在报道中是这样出现的

「强调了涵盖图像、语音、视频的多模态性能」——意思是文字之外的能力,尤其是「看和听」的能力,已成为产品的卖点。

亲手试一试

  1. 拍一张手写笔记、收据或黑板的照片。
  2. 把照片上传到ChatGPT或Claude,输入「把这上面写的内容整理成表格」。
  3. 把非文字的东西(照片)转换成文字——这就是多模态在起作用。

相关词条

出现过这个词的报道

目前还没有报道用到这个词。有新报道时会自动出现在这里。

浏览全部词条