• linkedu视频
  • 平面设计
  • 电脑入门
  • 操作系统
  • 办公应用
  • 电脑硬件
  • 动画设计
  • 3D设计
  • 网页设计
  • CAD设计
  • 影音处理
  • 数据库
  • 程序设计
  • 认证考试
  • 信息管理
  • 信息安全
菜单
linkedu.com
  • 网页制作
  • 数据库
  • 程序设计
  • 操作系统
  • CMS教程
  • 游戏攻略
  • 脚本语言
  • 平面设计
  • 软件教程
  • 网络安全
  • 电脑知识
  • 服务器
  • 视频教程
  • vbs
  • DOS/BAT
  • hta/htc
  • python
  • perl
  • VBA
  • ColdFusion
  • ruby
  • PowerShell
  • Lua
  • Golang
  • linux shell
您的位置:首页 > 脚本语言 >python > Python打印scrapy蜘蛛抓取树结构的方法

Python打印scrapy蜘蛛抓取树结构的方法

作者: 字体:[增加 减小] 来源:互联网

通过本文主要向大家介绍了python爬虫scrapy,python scrapy,python3.5 scrapy,python scrapy安装,scrapy python3等相关知识,希望对您有所帮助,也希望大家支持linkedu.com www.linkedu.com

本文实例讲述了Python打印scrapy蜘蛛抓取树结构的方法。分享给大家供大家参考。具体如下:

通过下面这段代码可以一目了然的知道scrapy的抓取页面结构,调用也非常简单

#!/usr/bin/env python
import fileinput, re
from collections import defaultdict
def print_urls(allurls, referer, indent=0):
  urls = allurls[referer]
  for url in urls:
    print ' '*indent + referer
    if url in allurls:
      print_urls(allurls, url, indent+2)
def main():
  log_re = re.compile(r'<GET (.*?)> \(referer: (.*?)\)')
  allurls = defaultdict(list)
  for l in fileinput.input():
    m = log_re.search(l)
    if m:
      url, ref = m.groups()
      allurls[ref] += [url]
  print_urls(allurls, 'None')
main()
</div>

希望本文所述对大家的Python程序设计有所帮助。

</div>

您可能想查找下面的文章:

  • 使用Python的Scrapy框架十分钟爬取美女图
  • 使用Python的Scrapy框架十分钟爬取美女图
  • 讲解Python的Scrapy爬虫框架使用代理进行采集的方法
  • 讲解Python的Scrapy爬虫框架使用代理进行采集的方法
  • Python爬虫框架Scrapy实战之批量抓取招聘信息
  • Python使用Scrapy爬取妹子图
  • Python使用Scrapy爬取妹子图
  • 使用Python的Scrapy框架编写web爬虫的简单示例
  • Python基于scrapy采集数据时使用代理服务器的方法
  • Python使用scrapy采集数据时为每个请求随机分配user-agent的方法

相关文章

  • python实现的防DDoS脚本
  • python访问类中docstring注释的实现方法
  • Python读写配置文件的方法
  • python实现k均值算法示例(k均值聚类算法)
  • python使用webbrowser浏览指定url的方法
  • 使用Python对Access读写操作
  • Python中的Numpy入门教程
  • Python使用scrapy抓取网站sitemap信息的方法
  • Python文件夹与文件的操作实现代码
  • Python的Flask框架及Nginx实现静态文件访问限制功能

文章分类

  • vbs
  • DOS/BAT
  • hta/htc
  • python
  • perl
  • VBA
  • ColdFusion
  • ruby
  • PowerShell
  • Lua
  • Golang
  • linux shell

最近更新的内容

    • Python脚本实时处理log文件的方法
    • python实现红包裂变算法
    • python编程实现希尔排序
    • Python中使用Beautiful Soup库的超详细教程
    • Django集成百度富文本编辑器uEditor攻略
    • python实现下载指定网址所有图片的方法
    • Python正则获取、过滤或者替换HTML标签的方法
    • Django框架中方法的访问和查找
    • python daemon守护进程实现
    • Python基于smtplib实现异步发送邮件服务

关于我们 - 联系我们 - 免责声明 - 网站地图

©2020-2025 All Rights Reserved. linkedu.com 版权所有