• linkedu视频
  • 平面设计
  • 电脑入门
  • 操作系统
  • 办公应用
  • 电脑硬件
  • 动画设计
  • 3D设计
  • 网页设计
  • CAD设计
  • 影音处理
  • 数据库
  • 程序设计
  • 认证考试
  • 信息管理
  • 信息安全
菜单
linkedu.com
  • 网页制作
  • 数据库
  • 程序设计
  • 操作系统
  • CMS教程
  • 游戏攻略
  • 脚本语言
  • 平面设计
  • 软件教程
  • 网络安全
  • 电脑知识
  • 服务器
  • 视频教程
  • dedecms
  • ecshop
  • z-blog
  • UcHome
  • UCenter
  • drupal
  • WordPress
  • 帝国cms
  • phpcms
  • 动易cms
  • phpwind
  • discuz
  • 科汛cms
  • 风讯cms
  • 建站教程
  • 运营技巧
您的位置:首页 > CMS教程 >建站教程 > PHP如何只抓取网页头

PHP如何只抓取网页头

作者:站长图库 字体:[增加 减小] 来源:互联网 时间:2022-04-29

站长图库向大家介绍了PHP抓取,抓取网页头等相关知识,希望对您有所帮助

php只抓取网页头的方法:1、使用get_headers()函数;2、使用http_response_header方法;3、使用stream_get_meta_data()函数;4、使用php CURL来获取网页头即可。


PHP如何只抓取网页头


php如何只抓取网页头?

php获取网页header信息的4种方法

php获取网页header信息的方法多种多样,就php语言来说,我知道的方法有4种, 下面逐一献上。


方法一:使用get_headers()函数

推荐指数: ★★★★★

get_header方法最简单只要两行代码即可搞定。如下:

$thisurl = "http://www.zztuku.com/";print_r(get_headers($thisurl, 1));

得到的结果为:

Array(    [0] => HTTP/1.1 200 OK    [Cache-Control] => max-age=86400    [Content-Length] => 76102    [Content-Type] => text/html    [Content-Location] => http://www.zztuku.com/index.html    [Last-Modified] => Fri, 19 Jul 2013 03:52:30 GMT    [Accept-Ranges] => bytes    [ETag] => "50bc48643384ce1:5cb3"    [Server] => Microsoft-IIS/6.0    [X-Powered-By] => ASP.NET    [Date] => Fri, 19 Jul 2013 09:06:39 GMT    [Connection] => close)


方法二:使用http_response_header

推荐指数: ★★★

http_response_headerf方法也很简单,仅三行:

$thisurl = "http://www.zztuku.com";$html = file_get_contents($thisurl ); print_r($http_response_header);

得到的结果为:

Array(    [0] => HTTP/1.1 200 OK    [1] => Cache-Control: max-age=86400    [2] => Content-Length: 76102    [3] => Content-Type: text/html    [4] => Content-Location: http://www.zztuku.com/index.html    [5] => Last-Modified: Fri, 19 Jul 2013 03:52:30 GMT    [6] => Accept-Ranges: bytes    [7] => ETag: "50bc48643384ce1:5cb3"    [8] => Server: Microsoft-IIS/6.0    [9] => X-Powered-By: ASP.NET    [10] => Date: Fri, 19 Jul 2013 09:06:41 GMT    [11] => Connection: close)


方法三:使用stream_get_meta_data()函数

推荐指数: ★★★

使用stream_get_meta_data()代码也只需三行:

$thisurl = "http://www.zztuku.com/";$fp = fopen($thisurl, 'r'); print_r(stream_get_meta_data($fp));

得到的结果为:

Array(    [wrapper_data] => Array        (            [0] => HTTP/1.1 200 OK            [1] => Cache-Control: max-age=86400            [2] => Content-Length: 76102            [3] => Content-Type: text/html            [4] => Content-Location: http://www.zztuku.com/index.html            [5] => Last-Modified: Fri, 19 Jul 2013 03:52:30 GMT            [6] => Accept-Ranges: bytes            [7] => ETag: "50bc48643384ce1:5cb3"            [8] => Server: Microsoft-IIS/6.0            [9] => X-Powered-By: ASP.NET            [10] => Date: Fri, 19 Jul 2013 09:06:41 GMT            [11] => Connection: close        )    [wrapper_type] => http    [stream_type] => tcp_socket    [mode] => r+    [unread_bytes] => 1086    [seekable] =>     [uri] => http://www.zztuku.com/    [timed_out] =>     [blocked] => 1    [eof] => )


第四种方法: 使用php的高级函数 CURL()来获取

推荐指数: ★★★★

上面的三种方法能获取一般的网页header信息,如果想要获取更详细的header信息比如网页是否启用了GZip压缩。这时候可以用php的高级函数curl()来获取。

使用curl获得header可以检测GZip压缩

先贴出代码:

<?php$szUrl = 'http://www.zztuku.com/';$curl = curl_init();curl_setopt($curl, CURLOPT_URL, $szUrl);curl_setopt($curl, CURLOPT_HEADER, 1);  //输出header信息curl_setopt($curl, CURLOPT_RETURNTRANSFER, 1);  //不显示网页内容curl_setopt($curl, CURLOPT_ENCODING, ''); //允许执行gzip$data=curl_exec($curl); if(!curl_errno($curl)){    $info = curl_getinfo($curl);    $httpHeaderSize = $info['header_size'];  //header字符串体积    $pHeader = substr($data, 0, $httpHeaderSize); //获得header字符串    $split   = array("rn", "n", "r");  //需要格式化header字符串    $pHeader = str_replace($split, '<br>', $pHeader); //使用<br>换行符格式化输出到网页上    echo $pHeader;}?>

输出结果如下:

HTTP/1.1 200 OKCache-Control: max-age=86400Content-Length: 15189Content-Type: text/htmlContent-Encoding: gzipContent-Location: http://www.zztuku.com/index.htmlLast-Modified: Fri, 19 Jul 2013 03:52:28 GMTAccept-Ranges: bytesETag: "0268633384ce1:5cb3"Vary: Accept-EncodingServer: Microsoft-IIS/6.0X-Powered-By: ASP.NETDate: Fri, 19 Jul 2013 09:27:21 GMT

可以看到使用curl获取到的header信息多了这行:Content-Encoding: gzip,网页启用了GZip压缩。


分享到:QQ空间新浪微博腾讯微博微信百度贴吧QQ好友复制网址打印

您可能想查找下面的文章:

  • PHP如何只抓取网页头

相关文章

  • 2022-04-29Photoshop使用素材制作唯美的花体字
  • 2022-04-29PHP中fopen()函数的使用(附代码示例)
  • 2022-04-29如何解决“您的服务器没有安装这个php扩展”问题
  • 2022-04-29vue.js怎么实现二级下拉悬浮菜单
  • 2022-04-29Photoshop制作夹心饼干艺术字效果
  • 2022-04-29PHP如何删除Array数组指定key
  • 2022-04-29Discuz论坛更换域名,详细文件修改步骤
  • 2022-04-29分析 thinkphp5 显示render不兼容问题
  • 2022-04-29介绍Laravel8路由模块新增missing方法
  • 2022-04-29VUE中怎么导出excel文件?

文章分类

  • dedecms
  • ecshop
  • z-blog
  • UcHome
  • UCenter
  • drupal
  • WordPress
  • 帝国cms
  • phpcms
  • 动易cms
  • phpwind
  • discuz
  • 科汛cms
  • 风讯cms
  • 建站教程
  • 运营技巧

最近更新的内容

    • Photoshop绘制逼真的毛线衣图标教程
    • Photoshop制作超酷的燃烧火焰字教程
    • 手把手教你在html中引入另一个html文件的方法(详解)
    • Windows/Linux下Composer的安装与使用(详解)
    • php的mail函数发送UTF-8编码中文邮件时标题乱码怎么办?
    • jQuery url中文乱码怎么办
    • Photoshop制作绚丽的3D艺术字教程
    • 浅谈微信小程序中引入并使用自带和外部图标的方法
    • 帝国CMS整站源码搭建教程/帝国CMS数据恢复教程
    • Dedecms文章审核后给会员增加积分或者金币的办法

关于我们 - 联系我们 - 免责声明 - 网站地图

©2020-2025 All Rights Reserved. linkedu.com 版权所有