• linkedu视频
  • 平面设计
  • 电脑入门
  • 操作系统
  • 办公应用
  • 电脑硬件
  • 动画设计
  • 3D设计
  • 网页设计
  • CAD设计
  • 影音处理
  • 数据库
  • 程序设计
  • 认证考试
  • 信息管理
  • 信息安全
菜单
linkedu.com
导航菜单
  • 网页制作
  • 数据库
  • 程序设计
  • 操作系统
  • CMS教程
  • 游戏攻略
  • 脚本语言
  • 平面设计
  • 软件教程
  • 网络安全
  • 电脑知识
  • 服务器
  • 视频教程
  • windows
  • 服务器硬件
  • 服务器运维
  • 云计算
  • 虚拟化
  • IIS教程
  • Linux
  • Apache
  • Ftp
  • DNS
  • Nginx
您的位置:首页 > 服务器 >云计算 > Andrew Ng机器学习课程10补充,andrewng

Andrew Ng机器学习课程10补充,andrewng

作者:网友 字体:[增加 减小] 来源:互联网

本文主要包含Andrew Ng机器学习课程10补充,andrewng等服务器相关知识,网友希望可以进行参考

Andrew Ng机器学习课程10补充,andrewng


Andrew Ng机器学习课程10补充


VC dimension

讲到了如果通过最小化训练误差,使用一个具有d个参数的hypothesis class进行学习,为了学习好,一般需要参数d的线性关系个训练样本。到这里需要指出一点,这个结果是基于empirical risk minimization得到的,而对于那些大部分的discriminative的学习算法采用的通过最小化training error或者training error的近似值,前面推导的结论并不总是可以用,而对于non_ERM 学习,给出好的理论保证仍然是一个活跃的研究领域。

In other words, the number of training examples needed to learn “well” using H is linear in the VC dimension of H.而对于大部分的hypothesis classes,VC dimension粗略的等于参数的个数。


model selection

How can we automatically select a model that represents a good tradeoff between the twin evils of bias and variance?

最直观的方法:直接选择最smallest training error的hypothesis
这种方法不行,比如多项式的阶数,这种方法总会选择得到high-variance,high-degree polynomial model。

hold-out cross validation

随机把S分为训练集和验证集,在训练集上训练hypothesis model,在验证集上获取hypothesis,然后选择最小验证误差的hypothesis,之后再用全部的数据进行训练。但是对于那些对初始条件或者初始数据比较敏感的算法,最好不要再进行retraining,因为在训练集上表现好的model,并不一定意味着在验证集上也表现好。这种hold-out cross validation的方法主要的缺点就是waste样本数据,即使是采用了retraining。

k-fold cross validation

随机将S分割为大小相同的k份,每次在k-1份上进行训练,而在另外一份上进行validation,循环k次,将每次得到的误差进行平均作为estimated generalization error,然后挑选最低的model,最后retraining这个model在整个S上。一般选择k为10。

leave-one-out cross validation

上一个方法中,将k=样本数量m,就叫做leave-one-out cross validation。
上面两种方法进行cross validation都会有计算量的问题,实际上当样本数量足够多时,可以采用hold-out cross validation,样本数量不足而计算能力达到要求时,可以采用k-fold或者leave one out的cross validation。

Feature Selection

Feature Selection是model selection的一种特殊和重要的案例,主要有两种方法:前向搜索和后向搜索,前向搜索是从空集开始逐个添加剩余最好的进来,而后向搜索是从满集开始,逐个剔除其中最差的出去。这两种方法的缺点就是计算量大。
还有一种是filter feature selection,采用启发式的选择,计算量相比上面两种要小,主要的思想是计算xi与y的相关度,或者是互信息等。

版权声明:本文为博主原创文章,未经博主允许不得转载。

分享到:QQ空间新浪微博腾讯微博微信百度贴吧QQ好友复制网址打印

您可能想查找下面的文章:

  • Andrew Ng机器学习课程10补充,andrewng

相关文章

  • 商用公有云安全调研,云安全调研
  • HIVE的数据存储,HIVE数据存储
  • Java 调用Hive 自定义UDF,java调用hiveudf
  • jsp中用EL读取了数据库里面的时间,怎么设置格式显示的格式,jspel
  • Hadoop中自带的examples之wordcount应用案例,hadoopwordcount
  • 《转》OpenStack Ceilometer 安装配置和API说明,《转》openstack
  • 微软小冰、小娜不久相会在中国,微软相会在中国
  • RegionServer功能职责,regionserver职责
  • mongoVUE的增删改查操作使用说明;一、查询;1、精确查询;1)右键点击集合名,再左键点击Find;或者直接点击工具栏上的Find;2)查询界面,包括四个区域;{Find}区,查询条件格式{"se,m
  • MapReduce处理二次排序(分区-排序-分组),mapreduce二次

文章分类

  • windows
  • 服务器硬件
  • 服务器运维
  • 云计算
  • 虚拟化
  • IIS教程
  • Linux
  • Apache
  • Ftp
  • DNS
  • Nginx

最近更新的内容

    • KVM 【SNAT/DNAT2种配置实现以及扁平化网络模式(flat)实现/virsh2种动态迁移实现】,kvmsnat
    • Spark SQL and DataFrame Guide(1.4.1)——之DataFrames,sparkdataframe
    • Error: unable to connect to node 'rabbit@devlop-ceilo': nodedown,unabletoconnect
    • 云计算NA1
    • 关于Openstack的浅层次认知,openstack认知
    • hadoop文件系统详解--(1),
    • Spark编程指南V1.4.0(翻译),编程指南v1.4.0
    • flume 组件概述与列表
    • 关于Oozie的input-events和done-flag,oozieinput-events
    • spark-OutOfMemory:GC overhead limit exceeded 解决,timelimitexceeded

关于我们 - 联系我们 - 免责声明 - 网站地图

©2020-2025 All Rights Reserved. linkedu.com 版权所有