多模态(Multimodal)指一个 AI 模型能同时处理文字、图片、声音、视频等不止一种数据形式,把它们放在一起理解或生成。它解决的是单一输入的局限:过去你得先把一张图描述成文字才能提问,多模态让你直接把图和问题一起发过去,模型两样都读得懂。
一句话定义
多模态就是”一个模型,多种输入和输出”。纯文本模型只吃文字、吐文字;多模态模型能接收文字加图片,或文字加音频,再用文字或图片回答你。重点不在于它支持几种格式,而在于能不能把不同格式的信息关联起来,比如看着一张图回答图里的内容。
一个例子
最直观的例子是截一张报表图,直接问”哪个季度掉得最多”。你可以在 Google Gemini 这类工具里看到这种用法,上传文件后用自然语言提问,模型读图再回答,你不用手动把图里的数字抄成文字。要记住它的一个真实限制:官方说明大文件分析可能遗漏分散在各处的细节,所以关键结论最好回看原文核对。
和相近概念的区别
多模态和”功能多”不是一回事。一个产品既能画图又能写字,如果这两件事互不相通,那只是功能多,不叫多模态;多模态强调同一个模型把不同形式的信息放进同一次理解里。它的范围也比”跨模态生成”(比如文字生成图片)更宽,跨模态生成只是多模态的一种表现,多模态既管输入侧的多种格式,也管输出侧。
什么时候用得上
当你的问题本身就横跨好几种材料,多模态最省事。比如手里有一份文档、一张图和一个问题,想让 AI 一起看。Microsoft Copilot 这种嵌在办公套件里的工具就适合这个场景,把文件和提问放在一起处理。用之前先避开一个坑:它的产品名称相近,个人版、应用内版和组织版的账户权限容易混淆,功能可能对不上你以为的版本。还有一点,重要答案仍然需要你自己独立核验,模型读了多种材料不等于结论一定对。