← 全部课程
COMP5541
Machine Learning and Data Analytics
期末 70%(闭卷)· Quiz 9% · Assignment 10% · Group Project 11%。3 小时闭卷,选择题 + 数学计算题。
逐讲
L01 第 1 周 · 9-03
L01 Introduction to ML + KNN:把整本成交簿子背下来的那个中介
机器学习的三层地图,外加一个把训练集本身当模型的算法。
P01 习题课 第 1 周 · 9-03
P01 Practical 1:不计分,但期末的数学题全在这里
线代、微积分、概率、统计四节手算,外加一道 KNN 编程题的实测结论。
L02 第 2 周 · 9-17
L02 Linear Regression:中介 A 的定价公式是怎么调出来的
第一个参数模型:定一条直线,用数据把斜率和截距算出来或试出来。
期末复习怎么用
闭卷考额外考记忆:闭式解、梯度更新式、各类损失函数都要能默写。课件把要求分成 What / Why / How 三层,最易失分的是 Why 那层的辨析题——它横着出(「哪个算法不需要显式训练」),所以复习也得横着来。
- 1 按讲把页尾「必背」过一遍,公式那几条要真动笔默写,看过不算。
- 2 每讲的「完整例题」跟着算一遍,然后合上页面做「变式题」,算错就回到那一步重推,别只记结论。
- 3 把各讲的算法横着填进一张总表,辨析题只在表里才看得出差别;顺手扫「课件里的坑」,标了 [课件有误] 的按更正记。
要能动笔算的题型
这几类没有思考余量,练到不看提示就能做。
- KNN 手算
- 给测试点和训练集,算距离、按 K 投票,说明平票怎么处理
- 线性回归闭式解
- 给几个点,算出 w、b 和 MSE
- 梯度下降一步
- 给初值和学习率,算一次更新后的参数与损失
- 贝叶斯法则
- 写出含全概率分母的完整式子再代数
- 尺度与标准化
- 说明不标准化会怎样影响基于距离的算法
- 偏差与方差
- 给训练/测试误差的走势,判断欠拟合还是过拟合
复习的产物:自己填的表
填表本身就是复习,抄一份现成的没有用。
- 算法总表:范式、任务、参数还是非参数、假设、损失函数、优化方式、主要局限
- 范式对照表:监督信号的形式、典型任务、典型算法
- 数学公式默写表:闭卷要凭空写出来的那几个式子
累计考点表
各讲页尾「必背」的汇总,随讲次增长。复习时按讲回看,点讲次跳到那一页。
L01 · L01 Introduction to ML + KNN:把整本成交簿子背下来的那个中介
- Learning 的输入是带标签的训练数据、输出是一个模型,别名 training / fitting;Inferring 的输入是没见过的样本、输出是预测标签,别名 testing / prediction。
- ML 的三层坐标是 Paradigm(范式)/ Tasks(任务)/ Algorithms(算法);三个范式是 Supervised、Semi/Unsupervised、Reinforcement。
- 划分范式的依据是监督信号的形式,不按算法难度也不按数据量;同一个 DNN 在监督与无监督两栏里都出现。
- Parametric 是有限个参数(Linear Regression、PCA、NN),Non-parametric 是参数集合无界(KNN、Gaussian Processes),实质区别是模型复杂度是否随数据量增长。
- 参数模型的参数维数预先固定;非参数模型的复杂度可随数据增长,KNN 保留训练数据;KNN 训练开销约等于零,预测时要和全部 N 个训练点各算一次距离(课件给的朴素实现)。
- KNN 四步:算距离 → 距离升序排序 → 取前 K 个点及其标签 → 汇总;分类取最频繁的标签(投票),回归取 K 个邻居标签的均值或加权均值,只差第 4 步。
- 本例类别标签是无序类别,不能直接平均其编号;KNN 回归可取数值均值,分类可投票或汇总类别概率。
- KNN 的关键步骤是距离度量的选择,它由使用者定义;四大局限是预测慢、存储大、对特征尺度敏感必须归一化、维度灾难。
P01 · P01 Practical 1:不计分,但期末的数学题全在这里
- 矩阵乘法不满足交换律,左乘右乘连形状都不同:Xy 是 2×1,zᵀX 是 1×2;写前向传播时靠形状检查判断有没有写反
- 行列式非零 ⟺ 可逆 ⟺ 满秩 ⟺ 各列线性无关,四种说法是同一件事,题目会换着问
- 连续函数闭区间求最值:列出区间内驻点及不可导点 → 加上两端点 → 比较所有候选函数值;二阶导不能代替全局比较
- Hessian 判定表:正定为局部极小、负定为局部极大、不定为鞍点、半定则判据失效要看更高阶
- 梯度是列向量、Hessian 是对称矩阵,形状写错本身就是失分点;求偏导时把另一个变量当常数
- 拉格朗日乘子把约束优化写成 ∇f = λ∇g 逐分量联立,再代回约束;能几何解释的题用几何验算最快
- 贝叶斯公式的分母要用全概率公式展开;似然为零的假设后验直接被压成 0,这正是朴素贝叶斯需要平滑的原因
- 除以 n 的方差有偏且系统性偏小,E[V] = ((n−1)/n)·σ²;标准化时除以标准差 σ,不是方差
L02 · L02 Linear Regression:中介 A 的定价公式是怎么调出来的
- 本讲单输出线性回归是参数模型、输出一个标量;参数个数 = 特征维度 D + 1,由模型形态定,与训练样本数无关。
- 模型写成 y = wᵀx + b;在特征前补一列常数 1 可以把偏置 b 吸进 w,之后公式里只剩 w。
- 损失用均方误差 MSE:L(w,b) = (1/N) Σ (ȳⁿ − (wxⁿ + b))²;最小化平方和与最小化 MSE 解相同,换成 MAE 解一般不同。
- 一维闭式解 w = Σ(xⁿ−x̄)(ȳⁿ−ȳ) / Σ(xⁿ−x̄)²,b = ȳ − w·x̄,要能手算。
- 梯度下降四步:随机初始化 → 算损失判停 → 求梯度 → w ← w − η·∂L/∂w;更新方向永远与梯度相反,步长随梯度变小,必须设最大迭代次数。
- 加 x²、x³ 等高次项后仍是线性模型,因为对参数 w 线性;多项式基展开用来抓非线性关系,嵌套模型充分优化时,次数增加使训练误差不增。
- 嵌套模型充分优化时训练误差不增、测试误差常呈先降后升但不保证;训练集都拟合不了是大偏差(欠拟合),训练好测试差是大方差(过拟合)。
- 大偏差靠加特征或换更复杂的模型,仅加数据通常不能解决模型表达力不足;大方差靠正则化、更多数据或简化模型;选模型只能用验证集或 N 折交叉验证,测试集不参与任何选择。