• linkedu视频
  • 平面设计
  • 电脑入门
  • 操作系统
  • 办公应用
  • 电脑硬件
  • 动画设计
  • 3D设计
  • 网页设计
  • CAD设计
  • 影音处理
  • 数据库
  • 程序设计
  • 认证考试
  • 信息管理
  • 信息安全
菜单
linkedu.com
  • 网页制作
  • 数据库
  • 程序设计
  • 操作系统
  • CMS教程
  • 游戏攻略
  • 脚本语言
  • 平面设计
  • 软件教程
  • 网络安全
  • 电脑知识
  • 服务器
  • 视频教程
  • vbs
  • DOS/BAT
  • hta/htc
  • python
  • perl
  • VBA
  • ColdFusion
  • ruby
  • PowerShell
  • Lua
  • Golang
  • linux shell
您的位置:首页 > 脚本语言 >python > 教你用python3根据关键词爬取百度百科的内容

教你用python3根据关键词爬取百度百科的内容

作者:daisy 字体:[增加 减小] 来源:互联网

daisy 通过本文主要向大家介绍了python3下载百度云,python3,python3下载,廖雪峰python3,python3教程等相关知识,希望对您有所帮助,也希望大家支持linkedu.com www.linkedu.com

前言

关于python版本,我一开始看很多资料说python2比较好,因为很多库还不支持3,但是使用到现在为止觉得还是pythin3比较好用,因为编码什么的问题,觉得2还是没有3方便。而且在网上找到的2中的一些资料稍微改一下也还是可以用。

好了,开始说爬百度百科的事。

这里设定的需求是爬取北京地区n个景点的全部信息,n个景点的名称是在文件中给出的。没有用到api,只是单纯的爬网页信息。 

1、根据关键字获取url

由于只需要爬取信息,而且不涉及交互,可以使用简单的方法而不需要模拟浏览器。

可以直接

<strong>http://baike.baidu.com/search/word?word="guanjianci"</strong>
</div>
<strong>for </strong>l <strong>in </strong>view_names:
 <strong>'''http://baike.baidu.com/search/word?word=''' </strong><em># 得到url的方法
</em><em> </em>name=urllib.parse.quote(l)
 name.encode(<strong>'utf-8'</strong>)
 url=<strong>'http://baike.baidu.com/search/word?word='</strong>+name
</div>

这里要注意关键词是中午所以要注意编码问题,由于url中不能出现空格,所以需要用quote函数处理一下。

关于quote():

在 Python2.x 中的用法是:urllib.quote(text)  。Python3.x 中是urllib.parse.quote(text)   。按照标准,URL只允许一部分ASCII 字符(数字字母和部分符号),其他的字符(如汉字)是不符合URL标准的。所以URL中使用其他字符就需要进行URL编码。URL中传参数的部分(query String),格式是:name1=value1&name2=value2&name3=value3。假如你的name或者value值中的『&』或者『=』等符号,就当然会有问题。所以URL中的参数字符串也需要把『&=』等符号进行编码。URL编码的方式是把需要编码的字符转化为%xx的形式。通常URL编码是基于UTF-8的(当然这和浏览器平台有关)

例子:

比如『我,unicode 为 0x6211,UTF-8编码为0xE60x880x91,URL编码就是 %E6%88%91。

Python的urllib库中提供了quote和quote_plus两种方法。这两种方法的编码范围不同。不过不用深究,这里用quote就够了。 

2、下载url

用urllib库轻松实现,见下面的代码中def download(self,url) 

3、利用Beautifulsoup获取html 

4、数据分析

百科中的内容是并列的段,所以在爬的时候不能自然的按段逻辑存储(因为全都是并列的)。所以必须用正则的方法。

基本的想法就是把整个html文件看做是str,然后用正则的方法截取想要的内容,在重新把这段内容转换成beautifulsoup对象,然后在进一步处理。

可能要花些时间看一下正则。

代码中还有很多细节,忘了再查吧只能,下次绝对应该边做编写文档,或者做完马上写。。。

贴代码!

# coding:utf-8
'''
 function:爬取百度百科所有北京景点,
 author:yi
'''
import urllib.request
from urllib.request import urlopen
from urllib.error import HTTPError
import urllib.parse
from bs4 import BeautifulSoup
import re
import codecs
import json
 
class BaikeCraw(object):
 def __init__(self):
  self.urls =set()
  self.view_datas= {}
 
 def craw(self,filename):
  urls = self.getUrls(filename)
  if urls == None:
   print("not found")
  else:
   for urll in urls:
    print(urll)
    try:
     html_count=self.download(urll)
     self.passer(urll, html_count)
    except:
     print("view do not exist")
    '''file=self.view_datas["view_name"]
    self.craw_pic(urll,file,html_count)
     print(file)'''
 
 
 def getUrls (self, filename):
  new_urls = set()
  file_object = codecs.open(filename, encoding='utf-16', )
  try:
   all_text = file_object.read()
  except:
   print("文件打开异常!")
   file_object.close()
  file_object.close()
  view_names=all_text.split(" ")
  for l in view_names:
   if '?' in l:
    view_names.remove(l)
  for l in view_names:
   '''http://baike.baidu.com/search/word?word=''' # 得到url的方法
   name=urllib.parse.quote(l)
   name.encode('utf-8')
   url='http://baike.baidu.com/search/word?word='+name
   new_urls.add(url)
  print(new_urls)
  return new_urls
 
 def manger(self):
  pass
 
 def passer(self,urll,html_count):
  soup = BeautifulSoup(html_count, 'html.parser', from_encoding='utf_8')
  self._get_new_data(urll, soup)
  return
 
 def download(self,url):
  if url is None:
   return None
  response = urllib.request.urlopen(url)
  if response.getcode() != 200:
   return None
  return response.read()
 
 def _get_new_data(self, url, soup): ##得到数据
  if soup.find('div',class_="main-content").find('h1') is not None:
   self.view_datas["view_name"]=soup.find('div',class_="main-content").find('h1').get_text()#景点名
   print(self.view_datas["view_name"])
  else:
   self.view_datas["view_name"] = soup.find("div", class_="feature_poster").find("h1").get_text()
  self.view_datas["view_message"] = soup.find('div', class_="lemma-summary").get_text()#简介
  self.view_datas["basic_message"]=soup.find('div', class_="basic-info cmn-clearfix").get_text() #基本信息
  self.view_datas["basic_message"]=self.view_datas["basic_message"].split("\n")
  get=[]
  for line in self.view_datas["basic_message"]:
   if line != "":
   get.append(line)
  self.view_datas["basic_message"]=get
  i=1
  get2=[]
  tmp="%%"
  for line in self.view_datas["basic_message"]:
 
   if i % 2 == 1:
    tmp=line
   else:
    a=tmp+":"+line
    get2.append(a)
   i=i+1
  self.view_datas["basic_message"] = get2
  self.view_datas["catalog"] = soup.find('div', class_="lemma-catalog").get_text().split("\n")#目录整体
  get = []
  for line in self.view_datas["catalog"]:
   if line != "":
    get.append(line)
  self.view_datas["catalog"] = get
  #########################百科内容
  view_name=self.view_datas["view_name"]
  html = urllib.request.urlopen(url)
  soup2 = BeautifulSoup(html.read(), 'html.parser').decode('utf-8')
  p = re.compile(r'', re.DOTALL) # 尾
  r = p.search(content_data_node)
  content_data = content_data_node[0:r.span(0)[0]]
  lists = content_data.split('')
  i = 1
  for list in lists:#每一大块
   final_soup = BeautifulSoup(list, "html.parser")
   name_list = None
   try:
    part_name = final_soup.find('h2', class_="title-text").get_text().replace(view_name, '').strip()
    part_data = final_soup.get_text().replace(view_name, '').replace(part_name, '').replace('编辑', '') # 历史沿革
    name_list = final_soup.findAll('h3', class_="title-text")
    all_name_list = {}
    na="part_name"+str(i)
    all_name_list[na] = part_name
    final_name_list = []###########
    for nlist in name_list:
     nlist = nlist.get_text().replace(view_name, '').strip()
     final_name_list.append(nlist)
    fin="final_name_list"+str(i)
    all_name_list[fin] = final_name_list
    print(all_name_list)
    i=i+1
    #正文
    try:
     p = re.compile(r'', re.DOTALL)
     final_soup = final_soup.decode('utf-8')
     r = p.search(final_soup)
     final_part_data = final_soup[r.span(0)[0]:]
     part_lists = final_part_data.split('')
     for part_list in part_lists:
      final_part_soup = BeautifulSoup(part_list, "html.parser")
      content_lists = final_part_soup.findAll("div", class_="para")
      for content_list in content_lists: # 每个最小段
       try:
        pic_word = content_list.find("div",
                class_="lemma-picture text-pic layout-right").get_text() # 去掉文字中的图片描述
        try:
         pic_word2 = content_list.find("div", class_="description").get_text() # 去掉文字中的图片描述
         content_list = content_list.get_text().replace(pic_word, '').replace(pic_word2, '')
        except:
         conte
  


 

您可能想查找下面的文章:

  • 教你用python3根据关键词爬取百度百科的内容
  • 教你用python3根据关键词爬取百度百科的内容
  • python3模拟百度登录并实现百度贴吧签到示例分享(百度贴吧自动签到)
  • python3模拟百度登录并实现百度贴吧签到示例分享(百度贴吧自动签到)

相关文章

  • 在tensorflow中设置保存checkpoint的最大数量实例
  • 使用python实现baidu hi自动登录的代码
  • 浅谈python中的getattr函数 hasattr函数
  • 简单掌握Python的Collections模块中counter结构的用法
  • MySQL中表的复制以及大型数据表的备份教程
  • Python下的twisted框架入门指引
  • linux环境下安装pyramid和新建项目的步骤
  • Python 使用os.remove删除文件夹时报错的解决方法
  • 将图片文件嵌入到wxpython代码中的实现方法
  • python字典get()方法用法分析

文章分类

  • vbs
  • DOS/BAT
  • hta/htc
  • python
  • perl
  • VBA
  • ColdFusion
  • ruby
  • PowerShell
  • Lua
  • Golang
  • linux shell

最近更新的内容

    • python使用点操作符访问字典(dict)数据的方法
    • Python os模块学习笔记
    • 在Python中使用__slots__方法的详细教程
    • 深入解读Python解析XML的几种方式
    • python基础知识小结之集合
    • Python实现并行抓取整站40万条房价数据(可更换抓取城市)
    • python 循环while和for in简单实例
    • python抓取网页时字符集转换问题处理方案分享
    • python处理文本文件并生成指定格式的文件
    • 一个基于flask的web应用诞生 组织结构调整(7)

关于我们 - 联系我们 - 免责声明 - 网站地图

©2020-2025 All Rights Reserved. linkedu.com 版权所有