AIZY的小站
AI 术语

多模态是什么意思? Multimodal 大白话解释

Multimodal · 基础概念

一句话解释

一个模型能同时处理文字、图片、声音、视频等多种形式的内容。

打个比方

以前只会读文字的助手,现在既能看,又能听,还能说。就像从「只能收发短信」升级成「能视频通话」。

为什么你需要懂

你要判断一个工具能不能做这件事:拍张照问问题、识别发票、看图改图、听录音写纪要——这些都是多模态能力。

常见误解

以为多模态就是样样精通。很多模型是文字强、图像弱,具体能力要单独看,别只看宣传。

常见问题

多模态是什么意思?

一个模型能同时处理文字、图片、声音、视频等多种形式的内容。

多模态需要学会吗?

你要判断一个工具能不能做这件事:拍张照问问题、识别发票、看图改图、听录音写纪要——这些都是多模态能力。

相关术语