本次学习基于吴恩达机器学习视频以及书籍《机器学习》周志华

一.视频笔记

1.机器学习分类

分为监督学习,非监督学习

1.1监督学习

  • 映射输入到输出(x->y),给定的数据示例都与输出y有关

例如

  • 回归:房价预测,线性回归与非线性回归的应用,从无限多可能的输出数字中预测数字

  • 分类:乳腺癌检测,用1、0区分,还可以有第三种输出,对一个类别作出所有小部分可能的输出(有限)

 

  • 不止可以用一个输入值来预测输出,也可以用多个输入值来预测输出

例如:已知年龄以及肿瘤大小,用圆圈表示肿瘤为良性,用叉来表示肿瘤为恶性

学习算法决定将边界线拟合在数据中

1.2无监督学习

  • 给定的数据示例与输出y无关

  • 聚类算法(clustering algorithm):将未标记数据放入不同集群(获取没有标签的数据并尝试自动将他们分组到集群中),将相似的数据点组合在了一起

例如谷歌新闻,DNA数据遗传,客户信息数据库

 

 

  • 异常检测(Anomaly detection),找出异常数据点
  • 降维(Dimensionality reduction),将大数据集压缩成一个小的多的数据集,同时丢失尽可能少的信息

二.书籍笔记

第一章 绪论

1.1机器学习定义

机器学习,研究(how)通过计算的手段,利用经验来改善系统自身的性能,从数据中产生模型(model),即是研究“学习算法”(learning algorithm)。人的“经验”对应计算机中的“数据”,使计算机来学习这些经验数据,生成一个算法模型,在面对新的情况中,计算机便能作出有效的判断,这就是机器学习。

“模型”泛指从数据中学得的结果(仅该书)

为加深理解,借鉴笔记(来源:作者yv.l1.pnn):
经典教材的作者Mitchell给出了一个形式化的定义,假设

P:计算机程序在某任务类T上的性能。
T:计算机程序希望实现的任务类。
E:表示经验,即历史的数据集。
若该计算机程序通过利用经验E在任务T上获得了性能P的改善,则称该程序对E进行了学习。

1.2基础术语

通过上述定义,易知,要进行机器学习,基础(前提)是要有数据。

例如:已经收集了一批🍉的数据(色泽=青绿;根蒂=蜷缩;敲声=浊响), (色泽=乌黑;根蒂=稍蜷;敲声=沉闷), (色泽=浅自;根蒂=硬挺;敲声=清脆)……,每对括号是一条记录,''=''意思是''取值为''(初步感觉这与struct类型很像)

则称

这组记录的集合为数据集(data set)

每条记录为一个示例(instance)或样本(sample)

反映事件或对象在某方面的表现/性质(例如色泽,敲声等)的事项为属性(attribute)或特征(feature)

属性的取值(如青绿、乌黑)叫做属性值(attribute value)

属性张成的空间叫做属性空间(attribute space),样本空间(sample space)或输入空间

对于一条记录,如果在坐标轴(每种属性可以作为一个坐标轴)上表示,每个西瓜都可以用坐标轴中的一个点表示,一个点也是一个向量,例如(青绿,蜷缩,清脆),即每个西瓜为:一个特征向量(feature vector)

每个示例Xi由d个属性描述,则d称为样本Xi的维数(dimensionality)

从数据中学得模型的过程称为学习(learning)或训练(training)

计算机程序学习经验数据生成算法模型的过程中,所使用的数据称为训练数据(training data),每一条记录称为一个训练样本(training sample),训练样本组成的集合称为训练集(training set)

学得模型对应了关于数据的某种潜在规律,因此亦称为假设(hypothesis)

潜在规律本身,则称为真相或真实(ground-truth)

而上述学习过程的目的是找出或逼近真相

需获得训练样本的“结果”信息,如((色泽=青绿;根蒂=...;敲声=...),好瓜),来建立关于预测(prediction)的模型。此处关于示例结果的信息,如“好瓜”,称为标记(label)

拥有了标记信息的示例,则称为样例(example)

 预测值为离散值的问题(学习任务),称为分类(classification)。例如“好瓜” “坏瓜”,“良性肿瘤” “恶性肿瘤”

预测值为连续值的问题(学习任务),称为回归(regression)。例如房价问题

只涉及两个类别的任务,叫做二分类(binary classification)任务,称其中一个类为正类(positive class),另一个类为反类(negative class)

涉及多个类别的任务,叫做多分类(multi-class classification)任务

在完成模型的学习后,使用该模型进行预测的过程,称为测试(testing) ,而被预测的样本称为测试样本(testing sample)。如学得f(这个f指的是模型),对于测试例x,可以得到它的测试标记y=f(x)

聚类(clustering),是将训练集中的示例分为若干组,每组称为一个簇(cluster)

这些自动形成的簇maybe对应潜在的概念划分,如“浅色瓜” “深色瓜”,“本地瓜” “外地瓜”。这种学习过程利于了解数据的内在规律,更深入分析数据。

*聚类学习中,“浅色瓜”等概念并不是我们事先知道的,且学习过程中使用的训练样本不带标记信息

依据训练数据是否拥有标记信息,学习任务可分为监督学习(supervised learning)和非监督学习(unsupervised learning)

学得模型适用于新样本的能力,称为泛化(generalization)能力,而具有强泛化能力的模型可很好适用于整个样本空间。假设样本空间中全体样本服从一个未知“分布 " (distribution ) ,获得的每个样本都是独立
地从这个分布上采样获得的,即 “独立同分布" (independent and identically
distributed ,简称i.i.d)

 

1.3假设空间

归纳(induction)是从特殊到一般的泛化过程(从具体事实归结到一般性规律)

演绎(deduction)是从一般到特殊的特化(specialization)过程(从基础原理到具体状况)

狭义的归纳学习要求从训练数据中学得概念,故也称为概念学习或概念形成

例子在书上“该如何判断好瓜”

学习过程可看作在所有假设组成的空间中进行搜索的过程,搜索目标是找到和训练集匹配(fit)的假设

某种属性无论取何值都合适,那就用通配符*表示。如果某种概念根本就不成立,则用Ø表示这个假设。

搜索过程可以不断删除与正例不一致的假设,和(或)与反例一致的假设,最后就会得到与训练集一致(对所有训练样本能够进行正确判断)的假设,这就是学得的结果。

学习过程基于有限样本训练集进行,可能有多个假设与训练集一致,即存在着一个与训练集一致的假设集合,称为版本空间(version space)

 

1.4归纳偏好

机器学习算法在学习过程中对某种类型假设的偏好,称为归纳偏好(inductive bias),简称偏好

任何一个有效的机器学习算法必有其归纳偏好,归纳偏好看作是学习算法在可能很庞大的假设空间中对假设进行选择的启发式或价值观。

奥卡姆剃刀(Occam's razor)是一种常用、自然科学研究中最基本的原则,即“若有多个假设与观察一致,则选最简单的那个”。但它并不是唯一可行的原则,比如提问:假设1和假设2,哪一个更为“简单”?显然简单很难定义,所以这个问题就并不简单,需要借助其他机制来解决。

!总误差与学习算法无关,无论算法a有多聪明算法b有多笨,两者的期望值一样,即“没有免费的午餐”定理(NFL)。

但实际中,并不会出现NFL的前提:所有问题出现的机会相同,或所有问题同等重要。

 

1.5发展历程

1.6应用现状

1.7阅读材料

 

Logo

开源鸿蒙跨平台开发社区汇聚开发者与厂商,共建“一次开发,多端部署”的开源生态,致力于降低跨端开发门槛,推动万物智联创新。

更多推荐