《基于特权信息的灰色支持向量机》[81M]百度网盘|pdf下载|亲测有效
《基于特权信息的灰色支持向量机》[81M]百度网盘|pdf下载|亲测有效

基于特权信息的灰色支持向量机 pdf下载

出版社 社会出版社
出版年 2023-10
页数 390页
装帧 精装
评分 9.2(豆瓣)
限时特惠 00:00:00
活动结束后恢复原价
纸质书参考价 ¥23
电子版限时价 ¥5.99 省 18 元

选择版本

不满意全额退款
发货失败双倍赔偿
邮箱即时发送

内容简介

本篇主要提供基于特权信息的灰色支持向量机电子书的pdf版本下载,本电子书下载方式为百度网盘方式,点击以上按钮下单完成后即会通过邮件和网页的方式发货,有问题请联系邮箱ebook666@outlook.com

内容简介

Vapnik(瓦普尼克)于20世纪末提出的支持向量机结构,通过将样本从低微空间向高维空间的映射来实现样本的线性划分,从而可获得预测的通用规则。该理论的通用性、鲁棒性、计算高效性使机器学习理论研究取得飞速的发展。然而,实际工程的原始数据中可能隐含着一些非常规的信息,《基于特权信息的灰色支持向量机》称为特权信息。这些具有某种特殊意义的特权信息有的仅存在部分数据中,并且这些特权信息的收集往往十分困难。然而,医学、生物、电子、信息等领域的工程数据中的某些特权信息却具有十分重要的作用。《基于特权信息的灰色支持向量机》提出基于特权信息的灰色支持向量机理论,在对原始数据不做任何修改的情况下,能够很好地构造预测规则并能够很好地解决含有特权信息的工程实际问题,是对标准支持向量机的拓展与补充。

目录

目录
第1章支持向量机基本原理1
1.1支持向量机的产生与发展2
1.2支持向量机相关理论3
1.2.1统计学习理论3
1.2.2支持向量机训练算法3
1.2.3线性支持向量机5
1.2.4具有软间隔和优化的SVC7
1.2.5非线性支持向量机9
1.2.6核函数10
1.3支持向量机的研究现状10
1.3.1SVM的理论研究11
1.3.2改进的SVM训练算法11
1.3.3SVM方法的应用研究13
1.3.4SVM的研究进展15
1.3.5软件实现17
1.3.6本章小结17
第2章灰色系统基本原理19
2.1灰色系统理论的产生与发展20
2.2灰色系统简介20
2.2.1不确定方法20
2.2.2灰色系统的基本概念21
2.2.3灰色系统理论的基本原理21
2.2.4灰数21
2.3序列算子与灰色序列生成22
2.3.1冲击扰动系统与序列算子23
2.3.2缓冲算子的定义和性质24
2.3.3缓冲算子构造25
2.3.4均值生成算子27
2.3.5序列的光滑性28
2.3.6级比生成算子28
2.3.7累加生成算子和累减生成算子29
2.3.8灰指数律29
2.4灰色关联分析30
2.4.1灰色关联因素和关联算子集31
2.4.2灰色关联公理与灰色关联度32
2.4.3灰色关联分析的应用举例34
2.4.4广义灰色关联度36
2.4.5灰色相对关联度37
2.4.6灰色综合关联度38
2.5灰色系统模型40
2.5.1GM(1,1)模型40
2.5.2残差GM(1,1)模型42
2.6灰色系统预测46
2.6.1灰色预测46
2.6.2数列预测47
2.7本章小结50
第3章基于特权信息的支持向量机53
3.1基于特权信息的支持向量机一阶模型54
3.1.1基于特权信息的支持向量机基本原理54
3.1.2全部训练样本存在特权信息的支持向量机基本原理56
3.1.3全部训练样本存在特权信息且松弛变量改动的支持向量机基本原理58
3.1.4部分训练样本存在特权信息的支持向量机基本原理59
3.1.5特权信息来自多空间的支持向量机基本原理60
3.2基于特权信息的支持向量机二阶模型61
3.2.1部分样本存在特权信息且松弛变量改动的支持向量机基本原理61
3.2.2特权信息来自多空间且松弛变量改动的支持向量机基本原理62
3.2.3部分训练样本存在特权信息且特权信息来自多空间的支持向量机基本原理64
3.3基于特权信息的支持向量机三阶模型65
3.3.1部分训练样本存在特权信息来自多空间的松弛变量改动支持向量模型65
3.3.2部分训练样本存在特权信息且特权信息来自多空间的松弛变量改动支持向量模型的对偶问题66
3.4基于特权信息的灰色支持向量机模型67
3.4.1灰色支持向量机67
3.4.2基于特权信息的灰色支持向量机68
3.5本章小结70
第4章仿真实验71
4.1rSVM+的仿真实验72
4.1.1数据集72
4.1.2实验设置细节73
4.1.3仿真测试结果74
4.2pSVM+的仿真实验75
4.2.1数据集75
4.2.2实验设置细节76
4.2.3仿真测试结果77
4.3gSVM+的仿真实验79
4.3.1数据集79
4.3.2实验设置细节80
4.3.3仿真测试结果81
4.4本章小结83
第5章基于LIBSVM的SVM应用85
5.1LIBSVM的安装(MATLAB)86
5.1.1LIBSVM安装步骤86
5.1.2LIBSVM库文件说明88
5.2LIBSVM的数据格式及制作89
5.2.1LIBSVM的数据及其格式89
5.2.2LIBSVM数据格式制作90
5.3LIBSVM的使用方法90
5.3.1svm-scale的用法90
5.3.2svmtrain的用法91
5.3.3svmpredict的用法93
5.4SVM应用之意大利葡萄酒种类识别93
5.4.1数据集93
5.4.2数据预处理96
5.4.3训练与预测97
5.4.4参数选择98
5.5本章小结101
参考文献103
后记111

精彩书摘

第1章 支持向量机基本原理
  1.1 支持向量机的产生与发展
  1995 年Vapnik 在“Support-vector networks ”中提出[1]基于统计学习理论的支持向量机(support vector machine,SVM),也称为支持向量网络。它作为一种新模式识别的方法一直受到广大科研工作者的高度关注[2] 。同年,Vapnik 和Cortes 提出软间隔支持向量机[2],通过引进松弛变量ξi 判断数据xi 是否被误分(分类出现错误时ξi 大于0),同时在目标函数中,增加一个参数C用来惩罚非零松弛变量(即代价函数),SVM 的寻优过程是使平衡分隔的间距尽量*大化和误差补偿尽量*小化的平衡过程。1996 年,Drucker 等提出支持向量回归(support vector regression,SVR)的方法用于解决拟合问题[3]。SVR 同SVM 的出发点都是寻找*优超平面,但SVR 的目的不是找到两种数据的分割平面,而是找到能准确预测数据分布的平面,两者*终都转换为*优化问题的求解。1999 年,Mayoraz 和Alpaydin 研究的多分类SVM(multi-class support vector machines,Multi-SVM)方法正式发表。此外,在SVM 算法的基本框架下,研究者们针对不同的研究背景提出许多不同的改进算法[4] 。例如:Suykens 提出*小二乘支持向量机(least square support vector machine,LS-SVM)算法[5];Joachims 等提出SVM-light[6];Zhang 提出中心支持向量机(central support vector machine,CSVM)[7],Scholkoph 和Smola 提出v-SVM[8]。在研究各种噪声模型和支持向量机参数设置时发现上述改进模型中,支持向量机(v-SVM)是一种软间隔分类器模型。其中,参数v控制支持向量的数量和对分类不敏感的间隔外的点的数量。通过实验调整支持向量数占输入数据比例的下限,以及度量超平面偏差参数ρ,代替通常依靠经验选取的软间隔分类惩罚参数,可以确定*低泛化误差的v值。LS-SVM 则是用等式约束代替传统SVM 中的不等式约束[9],将求解二次规划问题变成解一组等式方程来提高算法效率。
  在算法实现方面,台湾大学的林智仁(Lin Chih-Jen)等对SVM 的典型应用进行相关总结,并设计开发了LIBSVM(a library for support vector machines )工具包[10] 。LIBSVM 是一个通用的SVM 工具包,主要用于解决分类、回归及分布估计等问题。该软件包提供几种常用的核函数供用户选择,并且具有不平衡样本加权和多类分类等功能。LIBSVM 工具包的突出贡献主要是可实现核函数参数选取及优化、完成实验结果的交叉核实(cross validation)。
  SVM-light 的特点则是通过引进缩水(shrinking )逐步简化二次规划问题,以及利用高速缓冲存储器(cache)的缓存技术来降低迭代运算的计算代价,解决大规模样本条件下SVM 学习的复杂性问题。
  1.2 支持向量机相关理论
  1.2.1 统计学习理论
  与传统统计学理论不同,统计学习理论(statistical learning theory,SLT)是建立在较坚实的理论基础之上,针对小样本统计问题建立的一套新型理论体系,在该体系下统计推理规则不仅考虑对渐近性能的要求,而且追求在有限信息条件下得到*优结果[11] 。它融合了很多现有方法,可有效解决许多难以解决的问题(比如神经网络结构选择问题、局部极优点问题等),同时也可以看作是基于数据的机器学习问题的一个特例,即有限样本情况下的特例。
  统计学习理论从一些观测(训练)样本出发,得到一些不能通过原理分析而得到的规律,再利用这些规律分析测试样本,从而利用训练获得规律对未知的样本进行较为准确的预测。例如,对全国未来几年国内生产总值进行预测时,需要先采集过去几年甚至几十年的国内生产总值的相关数据,并对其变化规律做出统计学方面的分析和归纳,从而得到一个总体的预测模型,这样就可以对未来几年的国内生产总值走势做出一个大概的估计和预测。
  显然,这里采集的国内生产总值的数据越准确、年份越长,分析归纳得到的统计规律就越准确,对未来国内生产总值的预测就越接近真实水平。如果只采集到过去几年的国内生产总值,那么得到的统计模型就会显得不够完美、准确。
  统计学习理论研究的主要问题包括以下几方面。
  (1)学习的统计性能:通过有限样本能否学习得到其中的一些规律?
  (2)学习算法的收敛性:学习过程是否收敛?收敛的速度如何?
  (3)学习过程的复杂性:学习器的复杂性、样本的复杂性、计算的复杂性如何?
  如今,统计学习理论在模式分类、回归分析、概率密度估计方面发挥着越来越重要的作用。
  1.2.2 支持向量机训练算法
  SVM 方法是Vapnik 等根据统计学习理论提出的一种新的机器学习方法,它以结构风险*小化原则为理论基础,通过适当地选择函数子集及该子集中的判别函数,使学习机器的实际风险达到*小,保证通过有限训练样本得到的小误差分类器,对*立测试集的测试误差仍然较小。
  在机器学习中,SVM 是一种有监督式学习模型和相关的学习算法,其分析用于数据的分类和回归分析。给定一组训练数据集,每个数据都被标记为属于两个类别中的一个或另一个,支持向量机训练算法建立一个模型,将新的数据分配给其中一个类别,
   3
  使其成为非概率二进制线性分类器。支持向量机模型将数据表示为空间中的点,将不同类别的数据通过一个尽可能大的清晰差距进行映射。然后,新的数据被映射到相同的空间,并根据它们落在分类面的哪一边来预测属于哪一种类别。
  除了实现线性分类,通过数据映射到高维特征空间,支持向量机可以有效地实现非线性分类问题,这种思想称为核技巧。
  当数据没有标记时,就不能再使用监督学习方法进行学习,这时需要一种非监督学习方法,这种方法试图找到数据中自然聚类的中心,然后将新的数据映射到这些已经形成的组。支持向量聚类算法是对支持向量机的一种改进,它被称为支持向量聚类,通常用于没有标记数据或仅标记部分数据作为分类过程的预处理的工业应用中。
  分类数据是机器学习中常见的任务。假设给定的数据点属于两类中的一个,目标是决定一个新数据点将属于哪个类。在利用支持向量分类的情况下,一个数据点可被视为一个p维向量,我们想知道:是否可以用一个p-1 维的超平面来分离这些点,这叫作线性分类器。当然,人们可以找到多个超平面来对同一数据集进行分类。一个合理的方案是选择一个*好的超平面,使它与每边*近的数据点之间的距离*大化。如果存在这样的超平面,那么称其为*大边缘超平面,其定义的线性分类器称为*大边缘分类器,或者称为*优稳定性感知器。
  支持向量机的基本思想是:*先,在线性可分情况下,在原空间寻找两类样本的*优分类超平面;在线性不可分的情况下,加入松弛变量进行分析,使用非线性映射将低维输入空间的样本映射到高维属性空间使其变为线性情况,从而使得在高维属性空间采用线性算法对样本的非线性进行分析成为可能,并在该特征空间中寻找*优分类超平面。其次,使用结构风险*小化原理在属性空间构建*优分类超平面,使得分类器得到全局*优,并在整个样本空间的期望风险以某个概率满足一定上界。
  SVM 的优点表现为以下几个方面。
  (1)基于统计学习理论中结构风险*小化原则和VC 维(vapnik-chervonenkis dimension )理论,具有良好的泛化能力,即由有限的训练样本得到小的误差能够保证使*立的测试集仍保持小的误差。
  (2)支持向量机的求解问题对应的是一个凸优化问题,因此局部*优解一定是全局*优解。
  (3)核函数的成功应用,将非线性问题转化为线性问题求解。
  (4)分类间隔*大化,使得支持向量机算法具有较好的鲁棒性。由于SVM 自身的突出优势,所以被越来越多的研究人员作为强有力的学习工具,以便于解决模式识别、回归估计等领域的难题。
  当然,SVM 也存在一定的局限性,例如下面几点。
  (1)SVM 算法对大规模训练样本难以实施。SVM 的空间消耗主要是存储训练样本和核矩阵,由于SVM 是借助二次规划来求解支持向量,而求解二次规划将涉及m阶矩阵的计算(m为样本的个数),当m数目较大时,该矩阵的存储和计算将耗费大
  (2)用SVM 解决多分类问题存在的困难。例如,**的支持向量机算法只给出二类分类的算法,而在数据挖掘的实际应用中,还要解决多分类的问题。虽然已有支持向量机多分类算法的研究,但分类效果往往不理想。这时,采用支持向量机算法进行多分类通常选择多个二类支持向量机的组合来解决,主要有一对多组合模式、一对一组合模式和SVM 决策树。
  (3)对缺失数据敏感,对参数和核函数选择敏感。支持向量机性能的优劣主要取决于核函数的选取,所以在对一个实际问题时,需要根据实际的数据模型选择合适的核函数,从而构造SVM 算法,目前比较成熟的核函数及其参数的选择都是人为根据经验来选取的,带有一定的随意性。在不同的问题领域,核函数应当具有不同的形式和参数,所以在选取时候应该将领域知识引入进来,但是目前还没有好的方法来解决核函数的选取问题。
  1.2.3 线性支持向量机
  在线性可分的情况下,寻找SVM *优分类面的基本思想可用图1.1 进行描述。图1.1 中,“×”点和“○”点代表两类样本,H为它们之间的分类超平面,H1,H2 分别为通过正、负两类样本的分类面,它们之间的距离叫作分类间隔(margin )。点用于分隔一维空间中的样本,直线用于分隔二维空间中的样本,平面用于分隔三维空间中的样本,高维空间中的样本用超平面来分隔。
  图1.1 *优分类面示意图ρ为分类间隔;r* 为几何距离
  *优分类面要求分类面不仅可以将两类数据正确分开,而且还能使分类间隔*大化。将两类数据正确分开保证了训练的错误率为0,也就是经验风险*小(为0)化。使分类间隔*大就是将实际数据分类的真实风险控制在*小。推广到高维空间,*优分类线就成为*优分类超平面。
  设线性可分的样本集为(, y)( i=1,2, ,n),x=(x, x", x)∈R, ∈+.是类别符号。d维空间中线性判别函数的一般形式为类别符号。d维空间中线性判别函数的一般形式为
  (1.1)
  分类线方程为
  (1.2)
  要求分类线对所有样本正确分类,就是要求它满足
  (1.3)
  当满足上述条件(1.1),并且使|| w|| 2 *小的分类面称为*优分类面,满足等式(1.3)的特定数据点(,ii ) 称为支持向量,它们恰好是*佳超平面*接近的数据点,显然它们“支持”*优分类面。将判别函数(1.1)进行归一化,使两类所有样本都满足|()|1=,也就是使离分
  gx类面*近样本的|()|1gx=,然后,从支持向量x* 到*优超平面的相应几何距离为
  (1.4)
  从图1.1 可以看出,分类间隔的值是
  (1.5)
  为了确保可以发现*大间隔超平面,支持向量聚类(support vector clustering,SVC)尝试相对于w和b*大化ρ
  (1.6)
  等价地
  (1.7)
  在这里,我们通常使用而不是以方便进行后续优化步骤。
  一般来说,通过使用拉格朗日乘数法来解决式(1.7)中的约束优化问题,称为原始问题。可构造以下拉格朗日函数: