课程/AI 入门教程

多模态:为什么 AI 能看图、听声音

前面几章你用过这些功能:把体检报告拍照发给 AI 让它解释、让它"看"截图帮你找按钮、让它把语音转成文字……

你有没有想过一个问题:AI 明明是个"文字接龙机器"(第 1 篇讲的),它怎么就能"看懂"图片、"听懂"声音了?

这一篇讲"多模态"——听起来高大上,原理其实很妙。

🔑 本篇心法:AI 有一台万能翻译机,能把图片、声音都翻译成"语言",再统一理解。

先说人话:"模态"是什么

模态 = 信息的样子。

文字是一种模态,图片是一种,声音是一种,视频是一种。

  • 只会处理文字的 AI:单模态
  • 文字、图片、声音都能处理的 AI:多模态

你熟悉的 DeepSeek、通义、豆包,现在都是多模态的——所以你才能把照片丢给它。

从"只会文字"到"全能"是怎么发生的

回忆第 1 篇:AI 读文字时,会把文字变成一串数字(你可以想象成"坐标"),意思相近的词,坐标也相近——"猫"和"狗"挨得近,"猫"和"股票"离得远。

多模态的思路,妙就妙在这:

把图片、声音,也翻译到同一套"坐标系统"里去。

  • 文字"一杯咖啡" → 一组数字坐标
  • 咖啡的照片 → 也翻译成一组数字坐标
  • 这两组坐标,非常接近

于是奇迹发生了:AI 虽然只会在"坐标"里思考,但文字、图像、声音全被映射进了同一个空间——它"看"一张咖啡图,就等价于读到"一杯咖啡"这几个字。

打个比方:AI 里住着一位翻译官。你递给它一张照片,它先在心里翻译:"这是……一杯咖啡,放在木桌上,旁边有笔记本。"——翻译成"语言"之后,剩下的活儿就是它的老本行了。

所以它能干这些

你给它它能做
一张体检报告照片解释每个指标什么意思、哪些偏高
一张手机截图告诉你"点哪里"、报错原因
一张手写数学题读题、解题、讲思路
一段会议录音转文字、提炼要点(第 5 章用过)
一段视频总结内容、找关键片段(较新的能力)

统一的心法:把这些都当成"给它喂资料"——它拿到资料后,翻译成语言,再按你要求处理。

但它的"眼睛"和"耳朵"有短板

理解了原理,短板就很好理解了——它的翻译会翻错:

短板表现应对
细节认不准数不清一张图里有几个人;把 6 认成 8涉及精确细节,自己数、自己核
小字看不清拍照模糊、字太小时容易读错拍清楚点、放大关键区域再拍
视频理解还年轻长视频常常抓不住细节先让它按章节总结,再逐段问
复杂图表会脑补对着柱状图"读"出不存在的趋势关键数字回到原始表格核对

共同规律:多模态适合"理解大意",不适合"精确计量"。

带图提问的正确姿势

想让 AI 看图看得准,提问也有讲究:

✅ 好的带图提问:

(上传体检报告照片)
这是一份体检报告,请重点看"血常规"部分:
1. 哪几项指标超出参考范围?
2. 用大白话解释每一项偏高的常见原因
3. 哪些情况建议去医院复查?

❌ 不好的带图提问:

(上传照片)帮我看一下

三个要点:① 说清这是什么;② 指明关注哪部分;③ 说清你要它干什么。给图不给任务,AI 只能泛泛而谈。


本篇小结

🔑 多模态 = 万能翻译官:把图片声音翻译成"语言"再理解。它擅长"看懂大意",不擅长"精确计量";带图提问要说清"看什么、干什么"。

下一篇是本章收官:市场上一大堆模型名字——GPT、Claude、DeepSeek、通义、豆包……它们到底有什么区别?给你一张选型大表。

💬 评论(0)

请登录后参与评论

加载中...