第 1 章 · 地基之一
机器学习坐标:从"程序"到"学会的程序"
这一章回答:机器学习到底在干什么?读完你会有三个清晰的锚点:传统程序与机器学习的区别、三大学习范式、神经网络的最小结构。
1.1 传统程序 vs 机器学习:规则谁写的?
先看一个你工作中真实的例子——违章风险判定:
图 1-1 核心区别一句话:传统程序是"人写好规则,机器执行";机器学习是"人给出例子,机器自己总结规则"
为什么需要后者?因为有些规则写不出来:比如"什么样的作业组合更容易出违章"——影响因素太多、太微妙,没人能列出一份完整的 if-else。但人类历史记录里藏着答案:只要数据足够多,机器就能把其中隐藏的规律"挤"出来。这就是机器学习的全部哲学。
1.2 三大学习范式:有答案 / 无答案 / 试错
| 范式 | 数据长什么样 | 机器学什么 | 你工作里的例子 |
|---|---|---|---|
| 监督学习 最常用 |
每个样本都有"标准答案"(标签) | 从输入预测答案:分类(是/否、属于哪类)、回归(预测一个数值) | 用历史违章记录预测新作业的风险等级(分类);用历史光伏数据预测明天的出力(回归) |
| 无监督学习 | 只有数据,没有答案 | 发现数据内部的结构:聚类(自动分组)、异常检测(找出不对劲的) | 把历史项目自动分成几类典型模式;在运营数据里自动揪出异常月份 |
| 强化学习 | 没有现成数据,只有"环境"和"奖励" | 通过试错学策略:做什么动作能积累最多奖励 | 电网调度优化、储能充放电策略(每次都"试"一下,看收益) |
这一套教材的主角——大语言模型——主要用监督学习的变体(预测下一个词)训练出来的,细节在第 4、5 章。
监督学习 = 带答案的习题集(做完对答案,越做越准);
无监督学习 = 给你一堆混在一起的乐高零件,自己分类整理(没有标准,但有结构);
强化学习 = 玩游戏(没人教,只有得分,自己摸索最优打法)。
1.3 模型 = 一个函数:特征与标签
所有机器学习模型,抽象来看都是同一个东西:
图 1-2 模型的本质:一个"输入 → 输出"的函数,中间是几百万甚至几千亿个可调参数
三个术语一次说清:
- 特征(feature):你用来做判断的输入信息。特征质量决定上限——就像做风险分析,你用到的数据维度越对,判断越准。
- 标签(label):标准答案。监督学习就是拿"特征→标签"的配对例子来训练。
- 模型(model):那个函数本身。训练 = 调整函数的参数,让它输出的预测越来越接近标签。
你在运营监控里做"指标设计"(选哪些量、怎么聚合)就是特征工程。区别只在于:过去是你自己拍脑袋定规则,现在可以让机器从数据里学规则。你的领域经验不会白费——它决定喂给机器哪些特征,这正是 AI 项目里最值钱的部分。
1.4 神经元:最简"智能单元"
神经网络的最小单元叫神经元(neuron),它做两件事:先加权求和,再过一道"闸门"。
图 1-3 一个神经元:每个输入带一个"权重 w"(重要性),加权求和后过激活函数(闸门)
拆开看:
- 权重 w 和偏置 b:就是那个"可调参数"。w 表示"这个输入有多重要"——就像你评估风险时,心里对每个因素打的权重。
- 激活函数 σ(通常叫 sigmoid):把任意大小的求和结果"挤"到 0 到 1 之间,可以当作概率读。数学上它是:σ(z)=1/(1+e-z)。不需要背公式,记住它是"压缩闸门"就行。
主任收集手下每个人的意见(x₁、x₂、x₃),按每个人的权威程度加权(w),先在心里加总(z),然后拍板给出一个 0~100% 的赞成度(σ(z))。权重就是主任对各人的信任度——训练,就是反复调整这些"信任度"直到拍板最准。
1.5 神经网络 = 乐高积木
单个神经元能力有限,但把成千上万个神经元一层层拼起来,能力会发生质变。结构就三样:
- 输入层:接收特征(比如 20 个特征就 20 个入口);
- 隐藏层:中间若干层,每层一堆神经元,前一层输出接后一层输入(全连接);
- 输出层:给出最终结果(分类给出概率,回归给出数值)。
图 1-4 "深度"就是指隐藏层多。每个圆圈和每条线都带参数,参数总数 = 网络的"容量"
关键认知:层数(深度)× 每层宽度(神经元数)= 参数数量 = 模型容量。GPT-4 级别的模型有约 1.8 万亿参数——可以想象成"1.8 万亿个信任度旋钮"。本书第 4 章会看到,Transformer 的"神经元"不是上面的简单结构,但"可调参数 + 数据驱动调整"这个大框架完全一样。
1.6 "学习"的真相:调参,而不是编程
把上面所有的拼图放到一起,机器学习的完整循环是:
- 随机初始化一堆参数(每个 w、b 先给个随机值)——相当于"一个瞎猜的初学者";
- 拿一批训练数据过一遍网络,得到预测;
- 算出预测和标准答案差多远(这就是损失,第 2 章主角);
- 根据差距大小,微调每个参数,让损失变小一点;
- 重复 2–4 成千上万次,直到损失足够小。
第 2 章会把第 4 步"怎么微调"讲透(梯度下降 + 反向传播)。这里先记住结论:学习 = 通过反复试错,把"随机"调成"精准"。整个过程中没有任何人给机器写"规则",规则自己从数据里长出来。
1.7 泛化 vs 死记硬背
训练的目标不是"把训练数据背下来",而是面对没见过的新数据也能答对——这叫泛化(generalization)。两个对应的坑:
| 欠拟合(underfitting) | 过拟合(overfitting) | |
|---|---|---|
| 表现 | 训练数据都学不好 | 训练数据完美,新数据很差 |
| 人话解释 | 学得太少,没学会 | 背得太死,不会举一反三 |
| 工作比喻 | 新人培训不足,什么都不会干 | 只会背标准答案模板,换个项目就抓瞎 |
| 对策 | 加大模型、多训练 | 加数据、加正则(约束)、早停 |
把训练数据当练习册,把没见过的数据当考试卷。学生(模型)的目标是"考试卷得高分",而不是"练习册倒背如流"。一个把所有练习册答案背下来的学生,考试一定崩——因为他背的是答案,不是方法。验证集(validation set)就是"模拟考试卷":训练过程中不断用它检查,防止模型只背练习册。
1.8 本章小结
- 机器学习 = 从数据里自动总结规律,而不是人写规则;
- 三大范式:监督(有答案)、无监督(无答案找结构)、强化(试错拿奖励);
- 模型 = 一个函数:输入特征 → 输出预测;
- 神经元 = 加权求和 + 闸门(激活函数);神经网络 = 神经元分层拼接;
- 学习 = 反复调参让损失变小;目标是泛化(考好没见过的卷子),防过拟合。
我刚学完机器学习入门,请用费曼教学法: 1. 用"违章风险判定"的工作例子,讲清监督学习里"特征、标签、模型、训练"四个词; 2. 解释为什么机器学习的规则是"从数据里长出来"的,而不是人写的; 3. 出 3 道选择题检查我是否分得清监督/无监督/强化学习,先别给答案。
自测题:打开配套《自测题与思考题》做第 1 章 Q1.1–Q1.4(先答后看答案)。