完成--svm分类示例
This commit is contained in:
parent
218dd5eb77
commit
acab570237
49
docs/ml.md
49
docs/ml.md
@ -94,4 +94,51 @@
|
||||
缺点
|
||||
线性决策边界:假设自变量和因变量之间存在线性关系,可能不适用于非线性数据。
|
||||
对异常值敏感:异常值可能对模型产生较大影响。
|
||||
多重共线性:自变量之间高度相关时,模型表现可能不佳。
|
||||
多重共线性:自变量之间高度相关时,模型表现可能不佳。
|
||||
|
||||
支持向量机(SVM):找到一个最优超平面来分离不同类别的数据点,并最大化类别之间的边界
|
||||
基本概念:
|
||||
1.超平面:
|
||||
在二维空间中,超平面是一条直线;在三维空间中,超平面是一个平面;在高维空间中,超平面是一个n-1维的子空间。
|
||||
超平面的方程可以表示为:wx+b=0
|
||||
2.间隔:
|
||||
间隔是超平面到最近数据点的距离。SVM的目标是最大化这个间隔。
|
||||
支持向量是距离超平面最近的那些数据点,它们决定了超平面的位置。
|
||||
3.硬间隔与软间隔
|
||||
硬间隔:要求所有数据点都被正确分类,且间隔最大化。适用于线性可分的数据。
|
||||
软间隔:允许一些数据点被错误分类,以提高模型的泛化能力。适用于线性不可分的数据。
|
||||
4.核函数
|
||||
用于将数据映射到高维空间,使得在高维空间中数据变得线性可分。
|
||||
常见的核函数包括:
|
||||
线性核:K(xi,xj)=xi⋅xjK(xi,xj)=xi⋅xj
|
||||
多项式核:K(xi,xj)=(γxi⋅xj+r)dK(xi,xj)=(γxi⋅xj+r)d
|
||||
径向基函数(RBF)核:K(xi,xj)=exp(−γ∥xi−xj∥2)K(xi,xj)=exp(−γ∥xi−xj∥2)
|
||||
Sigmoid核:K(xi,xj)=tanh(γxi⋅xj+r)K(xi,xj)=tanh(γxi⋅xj+r)
|
||||
5.目标函数:
|
||||
SVM的目标是最大化间隔,同时最小化分类误差。这可以通过以下优化问题来表示:
|
||||
|
||||
|
||||
约束条件:
|
||||
|
||||
适用场景:
|
||||
高维空间:
|
||||
文本分类:如垃圾邮件检测、情感分析。
|
||||
图像分类:如手写数字识别、人脸识别。
|
||||
非线性分类:
|
||||
生物信息学:如基因表达数据分析。
|
||||
金融:如信用评分、股票市场预测。
|
||||
小样本数据:
|
||||
医学诊断:如疾病预测、药物反应分析。
|
||||
工业应用:如故障检测、质量控制。
|
||||
多分类问题:
|
||||
手写数字识别:识别0-9的手写数字。
|
||||
图像分类:将图像分类到多个类别中。
|
||||
优缺点:
|
||||
优点:
|
||||
有效处理高维数据:在高维空间中表现良好。
|
||||
泛化能力强:通过最大化间隔,提高模型的泛化能力。
|
||||
灵活性强:通过使用不同的核函数,可以处理线性和非线性问题。
|
||||
缺点:
|
||||
计算复杂度高:对于大规模数据集,训练时间较长。
|
||||
参数选择敏感:核函数和参数的选择对模型性能影响较大。
|
||||
解释性差:相比线性模型,SVM的解释性较差。
|
||||
Loading…
Reference in New Issue
Block a user