• <del id="gycm0"></del>
    <abbr id="gycm0"></abbr>
    <fieldset id="gycm0"><table id="gycm0"></table></fieldset>

    PHP數(shù)據(jù)采集常用的方法 做網(wǎng)站很多時(shí)候需要用到數(shù)據(jù)采集入庫(kù)操作

    更新時(shí)間:2022-04-25 編輯:創(chuàng)始人 關(guān)注人次:0 云搜索


    是使用PHP程序,把其他網(wǎng)站中的信息抓取到我們自己的數(shù)據(jù)庫(kù)中、網(wǎng)站中。

     

    PHP制作采集的技術(shù):

    從底層的socket到高層的文件操作函數(shù),一共有3種方法可以實(shí)現(xiàn)采集。

    1. 使用socket技術(shù)采集:

    socket采集是最底層的,它只是建立了一個(gè)長(zhǎng)連接,然后我們要自己構(gòu)造http協(xié)議字符串去發(fā)送請(qǐng)求。

    例如要想獲取這個(gè)頁(yè)面的內(nèi)容,http://tv.youku.com/?spm=a2hww.20023042.topNav.5~1~3!2~A,用socket寫如下:

    <?php  
    //連接,$error錯(cuò)誤編號(hào),$errstr錯(cuò)誤的字符串,30s是連接超時(shí)時(shí)間  
    $fp=fsockopen("www.youku.com",80,$errno,$errstr,30);  
    if(!$fp) die("連接失敗".$errstr);  
       
    //構(gòu)造http協(xié)議字符串,因?yàn)閟ocket編程是最底層的,它還沒有使用http協(xié)議  
    $http="GET /?spm=a2hww.20023042.topNav.5~1~3!2~A HTTP/1.1\r\n";   //  \r\n表示前面的是一個(gè)命令  
    $http.="Host:www.youku.com\r\n";  //請(qǐng)求的主機(jī)  
    $http.="Connection:close\r\n\r\n";   // 連接關(guān)閉,最后一行要兩個(gè)\r\n  
       
    //發(fā)送這個(gè)字符串到服務(wù)器  
    fwrite($fp,$http,strlen($http));  
    //接收服務(wù)器返回的數(shù)據(jù)  
    $data='';  
    while (!feof($fp)) {  
    $data.=fread($fp,4096);  //fread讀取返回的數(shù)據(jù),一次讀取4096字節(jié)  
    }  
    //關(guān)閉連接  
    fclose($fp);  
    var_dump($data);  
    ?>

    打印出的結(jié)果如下,包含了返回的頭信息及頁(yè)面的源碼:



    2. 使用curl_一套函數(shù)

    curl把HTTP協(xié)議都封裝成了很多函數(shù),直接傳相應(yīng)參數(shù)即可,降低了編寫HTTP協(xié)議字符串的難度。

    前提:在php.ini中要開啟curl擴(kuò)展。

    2. 使用curl_一套函數(shù)

    curl把HTTP協(xié)議都封裝成了很多函數(shù),直接傳相應(yīng)參數(shù)即可,降低了編寫HTTP協(xié)議字符串的難度。

    前提:在php.ini中要開啟curl擴(kuò)展。

    [php]  view plain  copy

    1. //生成一個(gè)curl對(duì)象  

    2. $curl=curl_init();  

    3. //設(shè)置URL和相應(yīng)的選項(xiàng)  

    4. curl_setopt($curl, CURLOPT_URL, "http://www.youku.com");  

    5. curl_setopt($curl, CURLOPT_RETURNTRANSFER, 1);  //將curl_exec()獲取的信息以字符串返回,而不是直接輸出。  

    6. //執(zhí)行curl操作  

    7. $data=curl_exec($curl);  

    8. var_dump($data);  

    打印出的結(jié)果如下,只包含頁(yè)面的源碼:

    3. 直接使用file_get_contents(最頂層的)

    前提:在php.ini中設(shè)置允許打開一個(gè)網(wǎng)絡(luò)的url地址。


    [php]  view plain  copy

    1. //使用file_get_contents()  

    2. $data=file_get_contents("http://www.youku.com");  

    3. var_dump($data);  



    3種方式的選擇

    網(wǎng)絡(luò)之間通信主要使用的是以上三種。其中后兩種用的較多:如果要批量采集大量的數(shù)據(jù)時(shí)使用第二種【CURL】,性能好、穩(wěn)定。

    偶爾發(fā)幾個(gè)請(qǐng)求發(fā)的頻繁不密集時(shí)使用第三種。

     

    擴(kuò)展:圖片的防盜鏈如何破?

    比如7060網(wǎng)站上的圖片做了防盜鏈:在他的網(wǎng)站中可以看到圖片,把圖片拿到站外就無(wú)法訪問(wèn)。



    解決辦法:發(fā)HTTP時(shí)自己模擬referer即可:


    擴(kuò)展:有些要采集數(shù)據(jù)時(shí)時(shí)必須先登錄,可以使用模擬的試模擬在登錄狀態(tài)下的采集:

    a. 先用瀏覽登錄一下,登錄完,瀏覽器的COOKIE中就會(huì)有SESSIONID

    b. 發(fā)PHP發(fā)HTTP協(xié)議時(shí),把瀏覽器中的SESSIONID放到PHP的HTTP協(xié)議請(qǐng)求里,這樣就在以登錄的狀態(tài)發(fā)請(qǐng)求。

    總結(jié):所有客戶端發(fā)過(guò)來(lái)的數(shù)據(jù)都可以被模擬,所以服務(wù)器上的程序必須要必要的地方過(guò)濾客戶端的數(shù)據(jù)。


    什么時(shí)候用以上東西?接口開發(fā)時(shí)、采集時(shí)。

    二、數(shù)據(jù)采集

    例如我要采集這個(gè)url里的所有美國(guó)電影的信息,

    http://list.youku.com/category/show/c_96_a_%E7%BE%8E%E5%9B%BD_s_1_d_1_p_3.html

    則先要知道電影所在的節(jié)點(diǎn)的結(jié)構(gòu),我們使用firebug查看。


    然后開始寫代碼:完整代碼如下

    [php]  view plain  copy

    1. /** 

    2.  * 發(fā)一個(gè)GET請(qǐng)求獲取數(shù)據(jù) 

    3.  */  

    4. function get($url)  

    5. {  

    6.    global $curl;  

    7.    // 配置curl中的http協(xié)議->可配置的薦可以查PHP手冊(cè)中的curl_  

    8.    curl_setopt($curl, CURLOPT_URL, $url);  

    9.    curl_setopt($curl, CURLOPT_RETURNTRANSFER, TRUE);  

    10.    curl_setopt($curl, CURLOPT_HEADER, FALSE);  

    11.    // 執(zhí)行這個(gè)請(qǐng)求  

    12.    return curl_exec($curl);  

    13. }  

    14.    

    15. // 生成一個(gè)curl對(duì)象  

    16. $curl = curl_init();  

    17. $url='http://list.youku.com/category/show/c_96_a_%E7%BE%8E%E5%9B%BD_s_1_d_1_p_3.html';  

    18. $data=get($url);  

    19. // 匹配電影所在位置  

    20. $list_preg = '/<li class="yk-col4 mr1">.+<\/li>/Us';  

    21. // 匹配img標(biāo)簽上的src和alt  

    22. $img_preg = '/<img class="quic" _src="(.*)" src="(.*)" alt="(.*)" \/>/U';  

    23. //匹配電影的url  

    24. $video_preg='/<a href="(.*)" title="(.*)" target="(.*)"><\/a>/U';  

    25. //把所有的li存到$list里,$list是個(gè)二維數(shù)組  

    26. preg_match_all($list_preg,$data,$list);  

    27.    //var_dump($list);  

    28. foreach ($list[0] as $k => $v) {   //這里$v就是每一個(gè)li標(biāo)簽  

    29. /* 獲取圖片及電影名稱 

    30.     preg_match($img_preg,$v,$img);  //把匹配到的圖片的信息存到$img里 

    31.     var_dump($img); 

    32.     */  

    33.     /*獲取電影地址 

    34.     preg_match($video_preg,$v,$video);  //把匹配到的電影的信息存到$video里 

    35.     var_dump($video); 

    36. */  

    37.     preg_match($img_preg,$v,$img);  

    38.     preg_match($video_preg,$v,$video);  

    39.     echo $img[0].'<a href="'.$video[1].'">'.$video[2].'</a>';  

    40. }  


    測(cè)試:

    打印$list;


    打印$img


    打印$video


    最終效果


    如果需要把圖片拷貝到硬盤上,則在foreach循環(huán)里加上以下代碼:

    [php]  view plain  copy

    1. $imgData = get($img[1]);  

    2.    // 把圖片文件寫到硬盤上【下載】  

    3.    // 因?yàn)椴僮飨到y(tǒng)是GBK的,所以要把UTF8轉(zhuǎn)成GBK  

    4.    is_dir('./youkuimg/') ? ''mkdir('./youkuimg/');  

    5. file_put_contents('./youkuimg/'.mb_convert_encoding($img[3], 'gbk''utf-8').'.jpg'$imgData);  


    效果如下:在當(dāng)前目錄下的youkuimg目錄下就會(huì)有下載好的圖片。


    本文地址: http://www.szycspjx.com/show-244.html ,轉(zhuǎn)載請(qǐng)注明出處。

    最新動(dòng)態(tài)

    相關(guān)資訊

    服務(wù)支持

    我們珍惜您每一次在線詢盤,有問(wèn)必答,用專業(yè)的態(tài)度,貼心的服務(wù)。

    讓您真正感受到我們的與眾不同!

    主站蜘蛛池模板: 中文字幕精品久久久久人妻| 2022精品天堂在线视频| 人妻少妇精品视频二区| 国产vA免费精品高清在线观看| 少妇人妻偷人精品免费视频| 国产欧美精品一区二区三区四区| 国产欧美日韩精品丝袜高跟鞋| 日韩精品一区二区三区在线观看 | 精品亚洲A∨无码一区二区三区| 久久精品国产精品亜洲毛片| jizz国产精品| 亚洲精品欧美综合在线| 国内精品久久久久久野外| 国产精品一区二区久久国产| 无码国产69精品久久久久网站 | 国产精品无码一区二区三级| 无码人妻精品一区二区三区66| 亚洲国产人成精品| 日本精品一区二区三区在线视频一| 国产成人精品久久一区二区三区av| 国内精品久久国产大陆| 成人午夜精品网站在线观看| 国产AV国片精品| 99久久精品日本一区二区免费| 久久影院综合精品| 精品一区二区三区在线观看视频| 色国产精品一区在线观看| 色一乱一伦一图一区二区精品| 奇米精品视频一区二区三区| 日韩精品人妻系列无码专区 | 精品精品国产欧美在线小说区| 国产精品区AV一区二区| 国产精品爱搞视频网站| 国产精品乱伦| 精品久久久久久久久久久久久久久 | 999国内精品永久免费观看| 国产一精品一AV一免费| 久久精品国产亚洲av影院| 精品一区二区三区免费毛片爱| 成人午夜视频精品一区| 精品午夜久久福利大片|