K-文化的一切——从回归到 K-美妆,发送到您的邮箱订阅邮件›
K-文化术语词典/ㅁ/使用中会遇到的词
Multimodal
不仅能理解文字,还能同时理解和生成图像、声音、视频的能力。
模态(modality)指信息呈现的形式——文字、图像、声音、视频。多模态就是指一个模型能同时处理这几种形式。
早期的语言模型只能读文字、写文字,就像一个没有眼睛和耳朵、只能靠书信交流的笔友。多模态模型可以看懂一张照片里的内容,听懂说话并用语音回应,还能理解夹杂着表格和图表的文档。
如今的主力模型(最新版GPT、Claude、Gemini)默认都是多模态的。这也是为什么「拍一张冰箱照片就能获得菜谱推荐」成为可能,也是新模型发布时「语音对话」「屏幕理解」演示必不可少的原因。
「强调了涵盖图像、语音、视频的多模态性能」——意思是文字之外的能力,尤其是「看和听」的能力,已成为产品的卖点。
目前还没有报道用到这个词。有新报道时会自动出现在这里。