白话 AI 小百科
← 返回百科索引
模型原理 · 30 秒看懂

多模态

Multimodal

一句人话

能处理文字、图片、音频、视频等多种信息形式。

打个比方

从只会读文字,变成能看、能听、能说。

这个比方用于帮助入门,并不覆盖技术实现的所有细节。

什么时候需要它

图片理解、语音助手、视频创作。

先从实际任务理解概念,比死记英文缩写更有效。

别混淆

支持上传图片不代表所有模态能力都同样强。

如果这个概念会影响费用、数据或安全,请继续查看官方文档。