PHP获取Cookie模拟登陆CURL

要提取google搜索的部分数据,发现google对于软件抓取它的数据屏蔽的厉害,之前伪造下 USER-AGENT 就能够抓数据,可是如今却不行了。利用抓包数据发现,Google 判断了 cookies,当你没有cookies的时候,直接 返回 302 跳转,并且是连续几十个302跳转,根本抓不了数据。

所以,在发送搜索命令时,须要先提取 cookies 并保存,而后利用保存下来的这个cookies再次发送搜索命令便可正常抓数据了。这其实和论坛的模拟登陆一个道理,先POST登陆,获取cookies并保存,而后利用这个cookies访问就能够了。php

1、定义Cookie存储路径

必须使用绝对路径html

$cookie_jar = dirname(__FILE__)."/pic.cookie";

 2、获取Cookie

将cookie存入文件浏览器

$url = "http://1.2.3.4/"; $ch = curl_init(); curl_setopt($ch, CURLOPT_URL, $url); curl_setopt($ch, CURLOPT_HEADER, 0); curl_setopt($ch, CURLOPT_RETURNTRANSFER, true); curl_setopt($ch, CURLOPT_COOKIEJAR, $cookie_jar); $content = curl_exec($ch); curl_close($ch);

3、模拟浏览器获取验证码

该服务器验证码有漏洞,能够本身指定

取出cookie,一块儿提交给服务器,让服务器觉得是浏览器打开登录页面服务器

$ch = curl_init(); curl_setopt($ch, CURLOPT_URL, 'http://1.2.3.4/getCheckpic.action?rand=6836.185874812305'); curl_setopt($ch, CURLOPT_COOKIEFILE, $cookie_jar); curl_setopt($ch, CURLOPT_HEADER, 0); curl_setopt($ch, CURLOPT_RETURNTRANSFER, 1); $ret = curl_exec($ch); curl_close($ch);

4、POST提交cookie

$post = "name=2&userType=1&passwd=asdf&loginType=1&rand=6836&imageField.x=25&imageField.y=7"; $ch = curl_init(); curl_setopt($ch, CURLOPT_URL, "http://1.2.3.4/loginstudent.action"); curl_setopt($ch, CURLOPT_HEADER, false); curl_setopt($ch, CURLOPT_RETURNTRANSFER,1); curl_setopt($ch, CURLOPT_POSTFIELDS, $post); curl_setopt($ch, CURLOPT_COOKIEFILE, $cookie_jar); $result=curl_exec($ch); curl_close($ch);

5、到指定页面获取数据curl

$ch = curl_init(); curl_setopt($ch, CURLOPT_URL, "http://1.2.3.4/accountcardUser.action"); curl_setopt($ch, CURLOPT_HEADER, false); curl_setopt($ch, CURLOPT_HEADER, 0); curl_setopt($ch, CURLOPT_RETURNTRANSFER,0); curl_setopt($ch, CURLOPT_COOKIEFILE, $cookie_jar); $html=curl_exec($ch); // var_dump($html);
curl_close($ch);

原文地址: http://www.php100.com/html/php/lei/2013/0912/6164.html post

相关文章
相关标签/搜索