• linkedu视频
  • 平面设计
  • 电脑入门
  • 操作系统
  • 办公应用
  • 电脑硬件
  • 动画设计
  • 3D设计
  • 网页设计
  • CAD设计
  • 影音处理
  • 数据库
  • 程序设计
  • 认证考试
  • 信息管理
  • 信息安全
菜单
linkedu.com
  • 网页制作
  • 数据库
  • 程序设计
  • 操作系统
  • CMS教程
  • 游戏攻略
  • 脚本语言
  • 平面设计
  • 软件教程
  • 网络安全
  • 电脑知识
  • 服务器
  • 视频教程
  • vbs
  • DOS/BAT
  • hta/htc
  • python
  • perl
  • VBA
  • ColdFusion
  • ruby
  • PowerShell
  • Lua
  • Golang
  • linux shell
您的位置:首页 > 脚本语言 >python > Python使用Scrapy爬取妹子图

Python使用Scrapy爬取妹子图

作者:hebedich 字体:[增加 减小] 来源:互联网

hebedich 通过本文主要向大家介绍了python爬虫scrapy,python scrapy,python3.5 scrapy,python scrapy安装,scrapy python3等相关知识,希望对您有所帮助,也希望大家支持linkedu.com www.linkedu.com

Python Scrapy爬虫,听说妹子图挺火,我整站爬取了,上周一共搞了大概8000多张图片。和大家分享一下。

核心爬虫代码

# -*- coding: utf-8 -*-
from scrapy.selector import Selector
import scrapy
from scrapy.contrib.loader import ItemLoader, Identity
from fun.items import MeizituItem
 
 
class MeizituSpider(scrapy.Spider):
  name = "meizitu"
  allowed_domains = ["meizitu.com"]
  start_urls = (
    'http://www.meizitu.com/',
  )
 
  def parse(self, response):
    sel = Selector(response)
    for link in sel.xpath('//h2/a/@href').extract():
      request = scrapy.Request(link, callback=self.parse_item)
      yield request
 
    pages = sel.xpath("//div[@class='navigation']/div[@id='wp_page_numbers']/ul/li/a/@href").extract()
    print('pages: %s' % pages)
    if len(pages) > 2:
      page_link = pages[-2]
      page_link = page_link.replace('/a/', '')  
      request = scrapy.Request('http://www.meizitu.com/a/%s' % page_link, callback=self.parse)
      yield request
 
  def parse_item(self, response):
    l = ItemLoader(item=MeizituItem(), response=response)
    l.add_xpath('name', '//h2/a/text()')
    l.add_xpath('tags', "//div[@id='maincontent']/div[@class='postmeta clearfix']/div[@class='metaRight']/p")
    l.add_xpath('image_urls', "//div[@id='picture']/p/img/@src", Identity())
 
    l.add_value('url', response.url)
    return l.load_item()
</div>

项目地址:https://github.com/ZhangBohan/fun_crawler

以上所述就是本文的全部内容了,希望大家能够喜欢。

</div>

您可能想查找下面的文章:

  • 使用Python的Scrapy框架十分钟爬取美女图
  • 使用Python的Scrapy框架十分钟爬取美女图
  • 讲解Python的Scrapy爬虫框架使用代理进行采集的方法
  • 讲解Python的Scrapy爬虫框架使用代理进行采集的方法
  • Python爬虫框架Scrapy实战之批量抓取招聘信息
  • Python使用Scrapy爬取妹子图
  • Python使用Scrapy爬取妹子图
  • 使用Python的Scrapy框架编写web爬虫的简单示例
  • Python基于scrapy采集数据时使用代理服务器的方法
  • Python使用scrapy采集数据时为每个请求随机分配user-agent的方法

相关文章

  • Python的collections模块中namedtuple结构使用示例
  • 详解Python设计模式编程中观察者模式与策略模式的运用
  • 使用相同的Apache实例来运行Django和Media文件
  • Python下singleton模式的实现方法
  • Python闭包的两个注意事项(推荐)
  • Python中for循环和while循环的基本使用方法
  • Python多进程编程技术实例分析
  • Python实现二维有序数组查找的方法
  • Python实现合并字典的方法
  • Python自动生产表情包

文章分类

  • vbs
  • DOS/BAT
  • hta/htc
  • python
  • perl
  • VBA
  • ColdFusion
  • ruby
  • PowerShell
  • Lua
  • Golang
  • linux shell

最近更新的内容

    • Python中函数的用法实例教程
    • python实现颜色空间转换程序(Tkinter)
    • 用Python脚本生成Android SALT扰码的方法
    • Python基础中所出现的异常报错总结
    • Python用list或dict字段模式读取文件的方法
    • 详解Python中expandtabs()方法的使用
    • Python中实现的RC4算法
    • python 快速排序代码
    • 使用python 获取进程pid号的方法
    • python中pygame模块用法实例

关于我们 - 联系我们 - 免责声明 - 网站地图

©2020-2025 All Rights Reserved. linkedu.com 版权所有