课程/AI 入门教程

大模型原理:它是怎么"懂"你的话的

第 10 章|理解 AI(选学) 用得熟了,你也许会好奇"它到底是怎么做到的"——这一章写给那些想搞懂原理的人,全程不用公式。

📢 先说明:本章是选学内容,跳过完全不影响你使用 AI。但如果你好奇"它凭什么这么聪明",这一章会让你看得连连点头。放心,全程大白话,没有公式。

用了几章 AI,你大概见过它的高光时刻:写报告、改代码、讲笑话样样行。也见过它的翻车现场:编造不存在的书名、算错简单的账。

它到底是个什么东西?为什么这么强,又这么离谱?

这一篇用一个比喻讲透。

🔑 本篇心法:大模型的本质,是一场覆盖全人类知识的"超级接龙"——预测下一个字。

比喻:它是一场"超级接龙"

你一定玩过接龙:"床前明月____",你脱口而出"光"。

因为你读过这首诗,你知道下一个字是什么。

大模型干的事,本质一模一样——只不过它的"接龙"规模恐怖到离谱:

  • 读过的东西:几乎整个互联网的文章、书籍、代码(万亿字级别)
  • 接的龙:你打字时手机输入法也会猜下一个词,对吧?大模型就是输入法猜词的超级加强版——它不是猜一个词,是逐字把一整篇文章"接"出来。

所以你每次和 AI 对话,它其实在干一件事:根据你说的话,一个字一个字地,预测"接下来最应该出现什么字"。

为什么"只会接龙"能这么聪明?

你可能会问:接龙谁不会?怎么接龙就能写出报告、编出程序?

三个原因:

第一,读得太多。 一个人一生读一亿字顶天了,它读了万亿字级——相当于把人类公开写过的东西读了个遍。

第二,学的不是字,是"规律中的规律"。 为了接得准,它被迫学会了语法、事实、逻辑、风格——因为不掌握这些,接龙就会接错。"理解"是"接得准"的副产品。

第三,接得足够长,就像"想得足够深"。 它逐字生成时,前面的字会约束后面的字——像人写作文,写着写着思路就展开了。

打个比方:一个把图书馆全部读完的人,哪怕只会"接话",你问他什么他都能接得头头是道——听起来,就像懂了。

三个"黑话"的人话版

你一定听说过这些词,现在用人话讲清楚:

Token(词元):AI 眼里的话是"片段"

AI 处理文字时,不是按"字",是按**片段(Token)**切的。比如"人工智能"可能被切成"人工"和"智能"两块。

你只需要知道:AI 的"阅读速度"和"记忆容量"都按 Token 计算——这和下一篇要讲的"上下文窗口"直接相关。

参数量(7B / 70B):可以理解为"脑容量"

你见过"7B 模型""70B 模型"的说法。B = 十亿,参数量就是模型里可调节的"旋钮"数量。

人话版:参数越多 = 读过的规律存得越细 = 通常越聪明,但也越"费电费钱"。就像人的脑容量,但不完全等同——训练方法和数据质量同样关键。

涌现:量变引起质变

小模型只会简单接话;模型大到一定程度,突然就会了复杂推理、写代码——没人专门教过它。

这种"突然开窍"叫涌现。就像水加热到 100 度突然沸腾——之前每一度都在积累,沸点是那一下的质变。

那它到底"懂"了吗?

诚实的答案:它表现得像懂了,但那和人类的"懂"不是一回事。

  • 人类的懂:有真实世界的体验,知道"烫"是什么感觉
  • AI 的懂:掌握了关于"烫"的一切文字规律,但从未被烫过

这也解释了它的全部优点和全部毛病:

优点(接龙接得准)毛病(也只是接龙)
知识面横跨所有领域没有真实体验,遇到没见过的就"编"
表达流畅、条理清晰流畅 ≠ 正确(第 2 篇的"幻觉")
不知疲倦,即问即答没有真正的目标和动机

理解了这一点,你对 AI 的所有疑问——为什么强、为什么胡说、为什么"忘了"——就都有了答案。 本章后面几篇全是展开这个。


本篇小结

🔑 大模型 = 超级接龙:读遍人类的书,学会文字的规律,逐字预测下一个字。"像懂了"和"真懂了",不是一回事。

下一篇,解释它最著名的毛病:既然是接龙,那"胡说八道"(幻觉)就是必然的副产品。 为什么?怎么办?

💬 评论(0)

请登录后参与评论

加载中...