• linkedu视频
  • 平面设计
  • 电脑入门
  • 操作系统
  • 办公应用
  • 电脑硬件
  • 动画设计
  • 3D设计
  • 网页设计
  • CAD设计
  • 影音处理
  • 数据库
  • 程序设计
  • 认证考试
  • 信息管理
  • 信息安全
菜单
linkedu.com
导航菜单
  • 网页制作
  • 数据库
  • 程序设计
  • 操作系统
  • CMS教程
  • 游戏攻略
  • 脚本语言
  • 平面设计
  • 软件教程
  • 网络安全
  • 电脑知识
  • 服务器
  • 视频教程
  • windows
  • 服务器硬件
  • 服务器运维
  • 云计算
  • 虚拟化
  • IIS教程
  • Linux
  • Apache
  • Ftp
  • DNS
  • Nginx
您的位置:首页 > 服务器 >云计算 > Stanford机器学习[第六讲]-朴素贝叶斯算法,stanford第六讲

Stanford机器学习[第六讲]-朴素贝叶斯算法,stanford第六讲

作者:网友 字体:[增加 减小] 来源:互联网

本文主要包含Stanford机器学习[第六讲]-朴素贝叶斯算法,stanford第六讲等服务器相关知识,网友希望可以进行参考

Stanford机器学习[第六讲]-朴素贝叶斯算法,stanford第六讲



引文:由于之前讲过了朴素贝叶斯的理论Stanford机器学习[第五讲]-生成学习算法第四部分,同时朴素贝叶斯的算法实现也讲过了,见机器学习算法-朴素贝叶斯Python实现。那么这节课打算讲解一下朴素贝叶斯算法的具体计算流程,通过一个具体的实例来讲解。

PS:为了专注于某一个细节,本章节只抽取了视频的一部分来讲解,只讲解一个贝叶斯算法的计算流程,关于视频里面的具体内容请参考下面的视频链接。

讲解的实例是一个文本分类的例子,区分一句话是粗鲁的还是文明的,类别标签只有Yes或No,表示是粗鲁的和不是粗鲁的语句。

1.给定一个训练集

Words Label
my name is Devin. No
you are stupid. Yes
my boyfriend is SB. Yes
you looks very smart,I like you very much. No


上面这个数据集是我随机取的,label表示的是是否粗鲁。

2.处理数据

首先根据上面给出的数据构建出一个词库出来,如下:
【”my”,“name”,“is”,“Devin”,“you”,“are”,“stupid”,“boyfriend”,“SB”,“looks”,
“very”,“smart”,”like”,”much”】

这个词库总单词个数只有14个,相对而言比较少,这里只做个例子,单词多的情况下同样处理。

然后将每个样本映射到词库中,得到一个大的矩阵

my name is Devin you are stupid boyfriend SB looks very smart like much classLabel
1 1 1 1 0 0 0 0 0 0 0 0 0 0 0
0 0 0 0 1 1 1 0 0 0 0 0 0 0 1
1 0 1 0 0 0 0 1 1 0 0 0 0 0 1
1 0 0 0 2 0 0 0 0 1 2 1 1 1 0


上面是得到的一个词频矩阵,最后一栏表示的是类标号,下面通过这个词频举证来计算不同类标号下每个词发生的概率,即条件概率p(xi|y=1) 和p(xi|y=0)。

实际的处理中为了防止0概率的发生,通常是将词频矩阵初始化为1,这里就不这么做了,简单化计算吧。

3.计算

设几个变量:

  • numWords:表示单词的总数
  • p1Mat:表示正样本中各单词出现的次数矩阵
  • p0Num:表示负样本中各单词出现的次数矩阵
  • p1Vec:表示正负样本条件下的各单词的出现的概率,即条件概率p(xi
分享到:QQ空间新浪微博腾讯微博微信百度贴吧QQ好友复制网址打印

您可能想查找下面的文章:

  • Stanford机器学习[第六讲]-朴素贝叶斯算法,stanford第六讲

相关文章

  • Llama-impala on yarn的中间协调服务,llama-impalayarn
  • hadoop 运行jar文件,
  • 在spark上运行独立程序(Self-Contained Applications),selfcontained
  • libvirt网络过滤规则:禁止客户机(bridge方式)连接外网,libvirtbridge
  • What's Wrong With Hue Oozie Editor?,hueoozie
  • request.getScheme()的使用方法,request.getscheme
  • hadoop distcp 实现不同集群之间数据同步,hadoopdistcp
  • Managing Data in Containers,managingcontainers
  • 《转》ceilometer的数据采集机制入门,《转》ceilometer
  • 机器学习--Logistic回归算法案例,--logistic算法

文章分类

  • windows
  • 服务器硬件
  • 服务器运维
  • 云计算
  • 虚拟化
  • IIS教程
  • Linux
  • Apache
  • Ftp
  • DNS
  • Nginx

最近更新的内容

    • 云服务器 性能测试之web压力测试,web压力测试
    • 【解决】 CentOS6.6安装CM5.4的问题,centos6.6cm5.4
    • Hadoop之——搭建ZooKeeper服务器集群,hadoopzookeeper
    • nova event机制分析,novaevent机制
    • hive如何应对数据倾斜,hive应对数据倾斜
    • Hadoop学习---第三篇Hadoop的第一个Mapreduce程序,hadoopmapreduce
    • HDFS学习笔记(2)hdfs_shell & JavaAPI,hdfshdfs_shell
    • apache hadoop-2.6.0-CDH5.4.1 安装笔记,hadoop2.6.0安装
    • Linux配置时间服务器,linux配置服务器
    • Stanford机器学习[第六讲]-朴素贝叶斯算法,stanford第六讲

关于我们 - 联系我们 - 免责声明 - 网站地图

©2020-2025 All Rights Reserved. linkedu.com 版权所有