← 文章 / AI技术
LearningYard新学苑 6小时前 · 2026-09-26 11:10:30 · 6 阅读

多模态大模型:为什么AI现在开始能看懂图片和视频了

GPT-4之前,AI模型有明确的分工:自然语言模型处理文字,视觉模型处理图像。两者是独立的系统。

多模态大模型出现后,一个模型同时能看懂文字、图片、音频、视频。不是两个模型拼在一起,是一个模型真正"理解"了多种模态。

什么是多模态

模态(Modality)= 信息的表现形式

文字是一种模态,图像是一种模态,音频是一种模态,视频是一种模态。

配图

多模态模型 = 能同时处理多种模态的模型

真正的多模态不是"文本模型+图像模型"做拼接,是让不同模态在同一个表示空间里"对齐"。

多模态是怎么实现的

Image Tokenization(图像分词)

图像不能直接输入Transformer,需要先切成一个个小patch,每个patch映射成一个token。

类比:文字处理是把句子切成词(tokenize),图像处理是把图片切成16×16或32×32的小块(patch),每个patch变成一个向量表示。

多模态对齐(Alignment)

这是核心问题:如何让"苹果"这个文字token和苹果图片的patch在向量空间里距离近?

训练方法:海量图文对数据。让模型看 millions 张图片和对应的描述,学会"这个描述对应这个图片"。

CLIP(OpenAI)用的方法:

配图
  • 训练一个图像Encoder和一个文本Encoder
  • 对于配对的图文,最大化它们在向量空间的相似度
  • 对于不配对的图文,最小化相似度

训练完成后,"苹果"和苹果图片就在同一个空间里了。

多模态融合(Fusion)

得到图像的token表示和文本的token表示后,怎么融合?两种主流架构:

Cross-Attention:文本token去"查询"图像token,信息从图像流向文本 Flamingo架构:用GATED XATTN层控制图像信息流入语言模型的强度

主流多模态模型

GPT-4V(Vision):图像理解能力极强,能分析图表、理解梗图、看财报 Gemini:原生多模态,文本/图片/视频/音频一起训练 LLaVA:开源社区最流行的多模态模型之一,7B参数就能跑 Qwen-VL:阿里开源,支持中文的多模态模型

多模态的价值在哪里

应用场景一:文档理解

直接上传PDF截图、扫描件、图表截图,让AI理解并提取信息。比OCR+文本分析的流程简单很多,效果也更好。

配图

应用场景二:视频理解

不只是理解单帧图像,而是理解视频里的动作、时序、因果关系。比如"这段监控视频里发生了什么",AI能给出描述。

应用场景三:多模态对话

你给AI一张照片,问"这个菜怎么做",AI能识别食材并给出菜谱。

应用场景四:图文创作

输入文字描述,生成符合描述的图片;或者输入图片,生成描述、标题、配文。

多模态的挑战

挑战一:幻觉问题更严重

图像模型可能对图片内容"胡说八道",比如把图片里的物体认错。这种错误比文字幻觉更难发现,因为用户通常不会去验证"图片里到底有什么"。

挑战二:视频理解仍是难点

视频=图片+时间+音频,信息量远大于图片。目前的视频理解模型更多是"抽帧理解"而非"真正理解时空关系"。

挑战三:计算成本高

多模态模型的推理成本远高于纯文本模型。一张图片的token数量远大于一段文字的token数量,处理图片的大模型参数也比纯文本模型大得多。

多模态是AI发展的必然方向。真实世界本来就是多模态的——人类通过文字、图像、声音、手势同时获取信息。AI要真正理解世界,也需要多模态的能力。

原始来源: LearningYard新学苑

评论 (0)