人工智能入门:从机器学习到大模型
先把几个概念摆正
很多人第一次接触人工智能时,最容易被几个词绕晕:
- 机器学习
- 人工神经网络
- 深度学习
- 大模型
它们不是四个并列概念,而是一组层层递进、又有一点历史交叉的关系。
严格说,人工智能(AI)是最大的概念。早期 AI 里也有规则系统、搜索算法、专家系统等不依赖机器学习的方法。但如果只看今天最主流的 AI 技术路线,那么我们主要讨论的就是机器学习,以及机器学习下面的神经网络、深度学习和大模型。
可以先用一张简单的关系图理解:
人工智能(AI)
└── 机器学习(Machine Learning)
├── 传统机器学习方法
│ ├── 线性回归
│ ├── SVM
│ ├── 随机森林
│ └── KNN
└── 基于神经网络的方法
├── 浅层人工神经网络
└── 深度学习
├── CNN
├── RNN
├── Transformer
└── 大模型
机器学习:让机器从数据中学习规律
机器学习是今天主流 AI 的基础。
传统的软件是人把规则写进程序里:如果满足 A 条件,就执行 B 操作。机器学习不完全是这样。它更像是把大量数据交给算法,让算法自己从数据里总结规律,然后用这些规律去判断新问题。
比如:
- 根据房屋面积、位置、楼层预测房价
- 根据一封邮件的文字判断是不是垃圾邮件
- 根据用户行为判断他可能喜欢什么商品
- 根据图片内容判断里面是不是一只猫
从方法上看,机器学习大致可以分成两类。
第一类是传统机器学习方法,比如线性回归、SVM、随机森林、KNN 等。它们通常不依赖多层神经网络,而是通过人工设计的特征和相对明确的统计模型来完成预测或分类。
第二类是基于神经网络的方法。这类方法模仿人脑神经元之间的连接方式,用大量节点和参数来学习数据里的复杂规律。今天我们熟悉的深度学习和大模型,都属于这条路线的发展结果。
监督学习:机器如何找到正确答案
理解机器学习,可以从最经典的监督学习开始。
监督学习的特点是:训练数据里不只有输入,还有标准答案。比如我们给模型看很多套房子的面积、位置、楼层和成交价格,模型要学习的是:以后看到一套新房子时,应该如何预测它的价格。
它背后的最小模型,可以先写成一个非常简单的形式:
f(x) = wx + b
这个公式可以看作机器学习的一个原子单元。
x是变量,也叫特征。它是现实世界业务对象的数字化抽象。w是模型参数。它是机器从数据中学到的知识载体。b是偏置项。它可以理解为模型的基础倾向或默认修正量。f(x)是模型输出,也就是模型根据输入给出的预测结果。
如果 x 只有一个特征,比如房屋面积,那么 w 就是一个数字。如果 x 有很多特征,比如面积、楼层、城市、地铁距离、房龄,那么 x 和 w 都会变成一组数字,也就是向量。
这时公式可以更准确地理解为:
f(x) = w1x1 + w2x2 + w3x3 + ... + b
模型训练的本质,就是让机器不断调整这些 w,找到一组最合适的参数,让模型预测尽可能接近训练数据里的真实答案。
所以,监督学习里有三个核心要素。
第一,特征。特征是对现实世界对象的数字化描述。一个用户、一件商品、一张图片、一段文本,机器都不能直接“理解”,必须先被表示成数字。
第二,参数。参数是模型真正学到的东西。我们平时说模型有多少参数,本质上就是在说这个模型内部有多少可以被训练出来的数值。比如 70B 参数的大模型,意思是它大约有 700 亿个参数。参数量越大,模型的知识容量上限通常越高,但这不等于参数越多就一定越聪明,数据质量、训练方法和模型结构同样重要。
第三,训练数据集。训练数据集是很多个具体 case 及其结果的集合。每一条数据都像是在告诉模型:“看到这样的输入时,正确答案应该接近这个结果。”
从过程上看,监督学习大致包括三步。
第一步是特征工程,也就是把业务对象变成数字。比如把用户注册时间转成“注册天数”,把商品类型转成 One-hot 编码,把用户最近 30 天的购买次数转成一个数值特征。
第二步是准备训练数据集,也就是收集很多已经知道答案的样本。比如一万套房子的特征和成交价格,十万封邮件的文本和“是否垃圾邮件”的标签。
第三步是模型训练。训练的过程,就是通过优化算法不断寻找更好的 w。如果模型预测错了,就根据误差调整参数;反复很多次之后,模型就会逐渐学到输入和答案之间的规律。
这也解释了为什么机器学习可以被理解为:
机器如何找到正确答案的过程。
特征表示:从人工设计到模型自己学习
传统机器学习和深度学习,一个非常大的差别在于:特征到底由谁来设计。
在传统机器学习里,模型高度依赖人工特征工程。业务专家和算法工程师需要先判断哪些信息有用,再把这些信息设计成模型能理解的数字。
比如做用户增长预测时,人工特征可能包括:
- 用户注册天数
- 最近 7 天登录次数
- 最近 30 天购买次数
- 用户所在城市
- 用户设备类型
再比如做商品推荐时,人工特征可能包括:
- 商品类目
- 商品价格区间
- 商品历史销量
- 用户是否收藏过同类商品
- 用户是否购买过相似商品
这些特征设计得好,传统机器学习模型就可能表现不错;特征设计得不好,模型再努力也很难学到真正有价值的规律。所以在传统机器学习时代,经常会说一句话:特征工程决定了模型上限。
深度学习和大模型的变化在于,它们拥有更强的自主学习特征表示的能力。
也就是说,模型不再完全依赖人提前把所有特征设计好,而是可以在训练过程中自己学习:哪些局部模式重要,哪些组合关系重要,哪些上下文信息重要。
这也是为什么大模型可以直接处理原始文本和图像。
一段文本进入模型后,会先被转换成 token 和向量;一张图片进入视觉模型后,也会被切分、编码成向量。模型会在一层又一层计算中,自己学习这些向量背后的结构和关系。
所以可以这样理解:
传统机器学习把特征工程放在模型外面,主要由人来完成;深度学习和大模型把特征工程内化到模型训练中,让模型自己学习更复杂的特征表示。
人工神经网络:从浅层网络到深度学习
人工神经网络(Artificial Neural Network, ANN)是机器学习中的一类模型。
它的基本思想是:把很多简单的计算单元连接起来,每个单元接收输入、做一次计算,再把结果传给下一层。模型训练的过程,就是不断调整这些连接上的参数,让最终输出越来越接近正确答案。
人工神经网络比较特殊,因为它横跨了两个时代。
在早期,由于数据量、算力和训练方法都有限,神经网络通常比较浅,层数不多,能解决的问题也相对有限。这类浅层神经网络经常被放在传统机器学习的语境里讨论。
后来,随着互联网积累了海量数据,GPU 提供了更强算力,训练方法也不断成熟,神经网络开始变得更深、更大、更复杂。这时就进入了深度学习阶段。
所以可以这样理解:
不是所有神经网络都是深度学习,但深度学习基本上都是深层神经网络。
深度学习:更深的神经网络
深度学习的“深”,主要指神经网络的层数更深。
浅层神经网络可能只有一两层隐藏层,而深度学习模型可以有很多层。层数变深以后,模型可以逐层提取更复杂的特征。
以图像识别为例,模型的前几层可能先识别边缘、颜色和纹理;中间层开始识别局部形状;更高层再组合出眼睛、耳朵、轮廓,最后判断整张图是不是一只猫。
深度学习里有几类经典模型:
- CNN(卷积神经网络):常用于图像识别和视觉任务
- RNN(循环神经网络):曾经常用于文本、语音等序列任务
- Transformer:后来成为大模型时代最重要的基础架构之一
深度学习真正爆发,不只是因为模型更深,还因为它同时遇到了三个条件:
- 足够多的数据
- 足够强的 GPU 算力
- 更有效的训练方法和模型结构
这三件事凑在一起,才让深层神经网络从“理论上可行”,变成了“工程上好用”。
大模型:深度学习的特定分支
大模型不是凭空出现的新物种,而是深度学习发展到一定规模后的结果。
今天我们说的大模型,通常有几个特征:
- 参数规模非常大
- 使用海量数据进行预训练
- 以 Transformer 架构为主
- 具备比较强的泛化能力
- 可以在多种任务之间迁移
这里的关键是预训练。
过去很多机器学习模型是为某一个具体任务训练的,比如专门做垃圾邮件识别,或者专门做图片分类。而大模型会先在海量通用数据上学习语言、知识、模式和推理方式,然后再通过提示词、微调、工具调用等方式适配具体任务。
这也是为什么 ChatGPT 这类模型看起来更“通用”:它不是只会做一道题,而是先学到了大量通用模式,再根据你的问题临时组织答案。
有时我们会说大模型具备“涌现能力”。这个说法可以简单理解为:当模型规模、数据规模和训练规模变大以后,一些在小模型上不明显的能力开始变得明显,比如更好的上下文理解、多步骤推理、代码生成和跨领域迁移。
但入门阶段不需要把“涌现”想得太神秘。更朴素地说就是:规模变大以后,模型能学到的模式更多,组合能力也更强。
小结
这几个概念的关系可以概括成一句话:
机器学习是今天主流 AI 的基础;神经网络是机器学习中的一类方法;当神经网络变得足够深,就进入深度学习;当深度学习模型继续变大,并通过海量数据预训练,就形成了今天的大模型。
理解这条主线之后,再去看 ChatGPT、Claude、Gemini、Sora 或各种 AI Agent,就不会觉得它们是完全不同的东西。它们本质上都建立在这条技术演进路径上,只是在模型规模、训练数据、交互方式和应用场景上继续扩展。
Be the first to know when I post cool stuff
Subscribe to get my latest posts by email.
Thanks for signing up! Check your email to confirm your subscription.
Whoops, we weren't able to process your signup.