本文实例讲述了PHP实现抓取百度搜索结果页面【相关搜索词】并存储到txt文件。分享给大家供大家参考,具体如下:

一、百度搜索关键词【Devmax】

【Devmax】搜索链接

https://www.baidu.com/s?ie=utf-8&f=8&rsv_bp=0&rsv_idx=1&tn=baidu&wd=脚本之家&rsv_pq=ab33cfeb000086a2&rsv_t=7c65vT3KzHCNfGYOIn/DSS OQUiCycaspxWzSOBfkHYpgRIPKMI74WIi8K8&rqlang=cn&rsv_enter=1&rsv_sug3=1

搜索结果部分源代码:

<div id="rs"><div class="tt">相关搜索</div><table cellpadding="0"><tbody><tr><th><a href="/s?wd=游戏脚本一般都在哪找&amp;rsf=4562&amp;rsp=0&amp;f=1&amp;oq=脚本之家&amp;ie=utf-8&amp;rsv_idx=1&amp;rsv_pq=c1ff4bdb000208b4&amp;rsv_t=a1f2OCsgS6vkkBcxsdqfBfehkXoR65/tFlpSI30//Mmk6jQJEukZbv30XaM&amp;rqlang=cn&amp;rs_src=0&amp;rsv_pq=c1ff4bdb000208b4&amp;rsv_t=a1f2OCsgS6vkkBcxsdqfBfehkXoR65/tFlpSI30//Mmk6jQJEukZbv30XaM" rel="external nofollow" >游戏脚本一般都在哪找</a></th><td></td><th><a href="/s?wd=脚本怎么写&amp;rsf=4562&amp;rsp=1&amp;f=1&amp;oq=脚本之家&amp;ie=utf-8&amp;rsv_idx=1&amp;rsv_pq=c1ff4bdb000208b4&amp;rsv_t=a1f2OCsgS6vkkBcxsdqfBfehkXoR65/tFlpSI30//Mmk6jQJEukZbv30XaM&amp;rqlang=cn&amp;rs_src=0&amp;rsv_pq=c1ff4bdb000208b4&amp;rsv_t=a1f2OCsgS6vkkBcxsdqfBfehkXoR65/tFlpSI30//Mmk6jQJEukZbv30XaM" rel="external nofollow" >脚本怎么写</a></th><td></td><th><a href="/s?wd=脚本是什么意思&amp;rsf=4562&amp;rsp=2&amp;f=1&amp;oq=脚本之家&amp;ie=utf-8&amp;rsv_idx=1&amp;rsv_pq=c1ff4bdb000208b4&amp;rsv_t=a1f2OCsgS6vkkBcxsdqfBfehkXoR65/tFlpSI30//Mmk6jQJEukZbv30XaM&amp;rqlang=cn&amp;rs_src=0&amp;rsv_pq=c1ff4bdb000208b4&amp;rsv_t=a1f2OCsgS6vkkBcxsdqfBfehkXoR65/tFlpSI30//Mmk6jQJEukZbv30XaM" rel="external nofollow" >脚本是什么意思</a></th></tr><tr><th><a href="/s?wd=脚本之家app&amp;rsf=4562&amp;rsp=3&amp;f=1&amp;oq=脚本之家&amp;ie=utf-8&amp;rsv_idx=1&amp;rsv_pq=c1ff4bdb000208b4&amp;rsv_t=a1f2OCsgS6vkkBcxsdqfBfehkXoR65/tFlpSI30//Mmk6jQJEukZbv30XaM&amp;rqlang=cn&amp;rs_src=0&amp;rsv_pq=c1ff4bdb000208b4&amp;rsv_t=a1f2OCsgS6vkkBcxsdqfBfehkXoR65/tFlpSI30//Mmk6jQJEukZbv30XaM" rel="external nofollow" >Devmaxapp</a></th><td></td><th><a href="/s?wd=手机脚本制作&amp;rsf=4562&amp;rsp=4&amp;f=1&amp;oq=脚本之家&amp;ie=utf-8&amp;rsv_idx=1&amp;rsv_pq=c1ff4bdb000208b4&amp;rsv_t=a1f2OCsgS6vkkBcxsdqfBfehkXoR65/tFlpSI30//Mmk6jQJEukZbv30XaM&amp;rqlang=cn&amp;rs_src=0&amp;rsv_pq=c1ff4bdb000208b4&amp;rsv_t=a1f2OCsgS6vkkBcxsdqfBfehkXoR65/tFlpSI30//Mmk6jQJEukZbv30XaM" rel="external nofollow" >手机脚本制作</a></th><td></td><th><a href="/s?wd=手机脚本大全&amp;rsf=4562&amp;rsp=5&amp;f=1&amp;oq=脚本之家&amp;ie=utf-8&amp;rsv_idx=1&amp;rsv_pq=c1ff4bdb000208b4&amp;rsv_t=a1f2OCsgS6vkkBcxsdqfBfehkXoR65/tFlpSI30//Mmk6jQJEukZbv30XaM&amp;rqlang=cn&amp;rs_src=0&amp;rsv_pq=c1ff4bdb000208b4&amp;rsv_t=a1f2OCsgS6vkkBcxsdqfBfehkXoR65/tFlpSI30//Mmk6jQJEukZbv30XaM" rel="external nofollow" >手机脚本大全</a></th></tr><tr><th><a href="/s?wd=脚本游戏制作大师&amp;rsf=4562&amp;rsp=6&amp;f=1&amp;oq=脚本之家&amp;ie=utf-8&amp;rsv_idx=1&amp;rsv_pq=c1ff4bdb000208b4&amp;rsv_t=a1f2OCsgS6vkkBcxsdqfBfehkXoR65/tFlpSI30//Mmk6jQJEukZbv30XaM&amp;rqlang=cn&amp;rs_src=0&amp;rsv_pq=c1ff4bdb000208b4&amp;rsv_t=a1f2OCsgS6vkkBcxsdqfBfehkXoR65/tFlpSI30//Mmk6jQJEukZbv30XaM" rel="external nofollow" >脚本游戏制作大师</a></th><td></td><th><a href="/s?wd=游戏脚本制作教程&amp;rsf=4562&amp;rsp=7&amp;f=1&amp;oq=脚本之家&amp;ie=utf-8&amp;rsv_idx=1&amp;rsv_pq=c1ff4bdb000208b4&amp;rsv_t=a1f2OCsgS6vkkBcxsdqfBfehkXoR65/tFlpSI30//Mmk6jQJEukZbv30XaM&amp;rqlang=cn&amp;rs_src=0&amp;rsv_pq=c1ff4bdb000208b4&amp;rsv_t=a1f2OCsgS6vkkBcxsdqfBfehkXoR65/tFlpSI30//Mmk6jQJEukZbv30XaM" rel="external nofollow" >游戏脚本制作教程</a></th><td></td><th><a href="/s?wd=脚本精灵&amp;rsf=4562&amp;rsp=8&amp;f=1&amp;oq=脚本之家&amp;ie=utf-8&amp;rsv_idx=1&amp;rsv_pq=c1ff4bdb000208b4&amp;rsv_t=a1f2OCsgS6vkkBcxsdqfBfehkXoR65/tFlpSI30//Mmk6jQJEukZbv30XaM&amp;rqlang=cn&amp;rs_src=0&amp;rsv_pq=c1ff4bdb000208b4&amp;rsv_t=a1f2OCsgS6vkkBcxsdqfBfehkXoR65/tFlpSI30//Mmk6jQJEukZbv30XaM" rel="external nofollow" >脚本精灵</a></th></tr></tbody></table></div>

二、抓取并保存本地

 

源代码

index.php:

<form action="index.php" method="post">
<input name="q" type="text" />
<input type="submit" value="Get Keywords" />
</form>
<?php
header('Content-Type:text/html;charset=gbk');
class ComBaike{
  private $o_String=NULL;
  public function __construct(){
    include('cls.StringEx.php');
    $this->o_String=new StringEx();
  }
  public function getItem($word){
    $url = "http://www.baidu.com/s?wd=".$word;
    // 构造包头,模拟浏览器请求
    $header = array (
      "Host:www.baidu.com",
      "Content-Type:application/x-www-form-urlencoded",//post请求
      "Connection: keep-alive",
      'Referer:http://www.baidu.com',
      'User-Agent: Mozilla/5.0 (compatible; MSIE 9.0; Windows NT 6.1; WOW64; Trident/5.0; BIDUBrowser 2.6)'
    );
    $ch = curl_init ();
    curl_setopt ( $ch, CURLOPT_URL, $url );
    curl_setopt ( $ch, CURLOPT_HTTPHEADER, $header );
    curl_setopt ( $ch, CURLOPT_RETURNTRANSFER, 1 );
    $content = curl_exec ( $ch );
    if ($content == FALSE) {
    echo "error:" . curl_error ( $ch );
    }
    curl_close ( $ch );
    //输出结果echo $content;
    $this->o_String->string=$content;
    $s_begin='<div id="rs">';
    $s_end='</div>';
    $summary=$this->o_String->getPart($s_begin,$s_end);
    $s_begin='<div class="tt">相关搜索</div><table cellpadding="0"><tr><th>';
    $s_end='</th></tr></table></div>';
    $content=$this->o_String->getPart($s_begin,$s_end);
    return $content;
  }
  public function __destruct(){
    unset($this->o_String);
  }
}
if($_POST){
  $com = new ComBaike();
  $q = $_POST['q'];
  $str = $com->getItem($q); //获取搜索内容
  $pat = '/<a(.*?)href="(.*?)" rel="external nofollow" (.*?)>(.*?)<\/a>/i';
  preg_match_all($pat, $str, $m);
  //print_r($m[4]); 链接文字
  $con = implode(",", $m[4]);
  //生成文件夹
  $dates = date("Ymd");
  $path="./Search/".$dates."/";
  if(!is_dir($path)){
    mkdir($path,0777,true);
  }
  //生成文件
  $file = fopen($path.iconv("UTF-8","GBK",$q).".txt",'w');
  if(fwrite($file,$con)){
    echo $con;
    echo '<script>alert("success")</script>';
  }else{
    echo '<script>alert("error")</script>';
  }
  fclose($file);
}
?>

cls.StringEx.php:

<?php
header('Content-Type: text/html; charset=UTF-8');
class StringEx{
  public $string='';
  public function __construct($string=''){
    $this->string=$string;
  }
  public function pregGetPart($s_begin,$s_end){
    $s_begin==preg_quote($s_begin);
    $s_begin=str_replace('/','\/',$s_begin);
    $s_end=preg_quote($s_end);
    $s_end=str_replace('/','\/',$s_end);
    $pattern='/'.$s_begin.'(.*?)'.$s_end.'/';
    $result=preg_match($pattern,$this->string,$a_match);
    if(!$result){
      return $result;
    }else{
      return isset($a_match[1])?$a_match[1]:'';
    }
  }
  public function strstrGetPart($s_begin,$s_end){
    $string=strstr($this->string,$s_begin);
    $string=strstr($string,$s_end,true);
    $string=str_replace($s_begin,'',$string);
    $string=str_replace($s_end,'',$string);
    return $string;
  }
  public function getPart($s_begin,$s_end){
    $result=$this->pregGetPart($s_begin,$s_end);
    if(!$result){
      $result=$this->strstrGetPart($s_begin,$s_end);
    }
    return $result;
  }
}
?>

更多关于PHP相关内容感兴趣的读者可查看本站专题:《php curl用法总结》、《PHP网络编程技巧总结》、《PHP数组(Array)操作技巧大全》、《php字符串(string)用法总结》、《PHP数据结构与算法教程》及《PHP中json格式数据操作技巧汇总》

希望本文所述对大家PHP程序设计有所帮助。

PHP实现抓取百度搜索结果页面【相关搜索词】并存储到txt文件示例的更多相关文章

  1. 从iOS应用程序发送帖子到PHP脚本不工作…简单的解决方案就像

    我之前已经做了好几次了但是由于某些原因我无法通过这个帖子…我尝试了设置为_POST且没有的变量的PHP脚本……当它们未设置为发布时它工作精细.这是我的iOS代码:这里是PHP的一大块,POST变量不在正确的位置?我想这对于更有经验的开发人员来说是一个相当简单的答案,感谢您的帮助!解决方法$_POST是一个数组,而不是一个函数.您需要使用方括号来访问数组索引:

  2. swift学习2 元组 tuples

    swift中出现了一种新的数据结构,非常牛掰的元组tuples如果懂PHP的猿,会发现这个元组和PHP的数组非常类似,同样是可以默认不指定key,也可以指定key目前的学习疑问是,如何进行元组的遍历?

  3. 尝试使用swift mailer,gmail smtp,php发送邮件

    这里是我的代码:在运行时出现此错误…

  4. PHP使用JpGraph绘制折线图操作示例【附源码下载】

    这篇文章主要介绍了PHP使用JpGraph绘制折线图操作,结合实例形式分析了php使用JpGraph的相关操作技巧与注意事项,并附带源码供读者下载参考,需要的朋友可以参考下

  5. jQuery的Cookie封装,与PHP交互的简单实现

    下面小编就为大家带来一篇jQuery的Cookie封装,与PHP交互的简单实现。小编觉得挺不错的,现在就分享给大家,也给大家做个参考。一起跟随小编过来看看吧

  6. PHP+jquery+CSS制作头像登录窗(仿QQ登陆)

    本篇文章介绍了PHP结合jQ和CSS制作头像登录窗(仿QQ登陆),实现了类似QQ的登陆界面,很有参考价值,有需要的朋友可以了解一下。

  7. 如何在PHP环境中使用ProtoBuf数据格式

    这篇文章主要介绍了如何在PHP环境中使用ProtoBuf数据格式,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友可以参考下

  8. PHP rsa加密解密算法原理解析

    这篇文章主要介绍了PHP rsa加密解密算法原理解析,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友可以参考下

  9. PHP cookie与session会话基本用法实例分析

    这篇文章主要介绍了PHP cookie与session会话基本用法,结合实例形式分析了PHP cookie与session会话基本存储、设置、删除等相关使用方式,需要的朋友可以参考下

  10. PHP 匿名函数与注意事项详细介绍

    这篇文章主要介绍了PHP 匿名函数与注意事项详细介绍的相关资料,匿名函数是PHP5.3引进来了,php5.3不但引进了匿名函数还有更多更好多新的特性了,下面我们一起来了解一下PHP匿名函数与注意事项详解,需要的朋友可以参考下

随机推荐

  1. PHP个人网站架设连环讲(一)

    先下一个OmnihttpdProffesinalV2.06,装上就有PHP4beta3可以用了。PHP4给我们带来一个简单的方法,就是使用SESSION(会话)级变量。但是如果不是PHP4又该怎么办?我们可以假设某人在15分钟以内对你的网页的请求都不属于一个新的人次,这样你可以做个计数的过程存在INC里,在每一个页面引用,访客第一次进入时将访问时间送到cookie里。以后每个页面被访问时都检查cookie上次访问时间值。

  2. PHP函数学习之PHP函数点评

    PHP函数使用说明,应用举例,精简点评,希望对您学习php有所帮助

  3. ecshop2.7.3 在php5.4下的各种错误问题处理

    将方法内的函数,分拆为2个部分。这个和gd库没有一点关系,是ecshop程序的问题。会出现这种问题,不外乎就是当前会员的session或者程序对cookie的处理存在漏洞。进过本地测试,includes\modules\integrates\ecshop.php这个整合自身会员的类中没有重写integrate.php中的check_cookie()方法导致,验证cookie时返回的username为空,丢失了登录状态,在ecshop.php中重写了此方法就可以了。把他加到ecshop.php的最后面去就可

  4. NT IIS下用ODBC连接数据库

    $connection=intodbc_connect建立数据库连接,$query_string="查询记录的条件"如:$query_string="select*fromtable"用$cur=intodbc_exec检索数据库,将记录集放入$cur变量中。再用while{$var1=odbc_result;$var2=odbc_result;...}读取odbc_exec()返回的数据集$cur。最后是odbc_close关闭数据库的连接。odbc_result()函数是取当前记录的指定字段值。

  5. PHP使用JpGraph绘制折线图操作示例【附源码下载】

    这篇文章主要介绍了PHP使用JpGraph绘制折线图操作,结合实例形式分析了php使用JpGraph的相关操作技巧与注意事项,并附带源码供读者下载参考,需要的朋友可以参考下

  6. zen_cart实现支付前生成订单的方法

    这篇文章主要介绍了zen_cart实现支付前生成订单的方法,结合实例形式详细分析了zen_cart支付前生成订单的具体步骤与相关实现技巧,需要的朋友可以参考下

  7. Thinkphp5框架实现获取数据库数据到视图的方法

    这篇文章主要介绍了Thinkphp5框架实现获取数据库数据到视图的方法,涉及thinkPHP5数据库配置、读取、模型操作及视图调用相关操作技巧,需要的朋友可以参考下

  8. PHP+jquery+CSS制作头像登录窗(仿QQ登陆)

    本篇文章介绍了PHP结合jQ和CSS制作头像登录窗(仿QQ登陆),实现了类似QQ的登陆界面,很有参考价值,有需要的朋友可以了解一下。

  9. 基于win2003虚拟机中apache服务器的访问

    下面小编就为大家带来一篇基于win2003虚拟机中apache服务器的访问。小编觉得挺不错的,现在就分享给大家,也给大家做个参考。一起跟随小编过来看看吧

  10. Yii2中组件的注册与创建方法

    这篇文章主要介绍了Yii2之组件的注册与创建的实现方法,非常不错,具有参考借鉴价值,需要的朋友可以参考下

返回
顶部