国产探花免费观看_亚洲丰满少妇自慰呻吟_97日韩有码在线_资源在线日韩欧美_一区二区精品毛片,辰东完美世界有声小说,欢乐颂第一季,yy玄幻小说排行榜完本

首頁 > 學院 > 開發設計 > 正文

獻給所有想學習正則和采集的朋友

2019-11-17 04:21:53
字體:
來源:轉載
供稿:網友

<?php
function get_url_content($Url,$Method = 'c') {
    //引入需要的語言編碼.如果沒有, 就會默認為utf-8,不必擔心.
    global $Charset;
    $Urlarr = parse_url($Url);
    //如果檢測不出域名,就返回.
    if (!isset($Urlarr['host'])) {
        return false;
    }
    //我們用智能方式定義header頭倍信息.
    foreach (@getallheaders() as $key => $val){
        $key==='Host' && $val = $Urlarr['host'];
        $key==='Referer' && $val ='http://'.$Urlarr['host'];
        $str .= "'$key:$val', /n";
    }
    //虛擬來路.
    !eregi('Referer',$str) && $str .="'Referer:http://{$Urlarr['host']}', /n";
    //經過修正, 基本上, 來路也是那個站, 主機也是Url站點.
    $Header = array(trim($str));
    //下面僅僅是選擇用哪個程序來采集.
    if($Method === 'f'&&function_exists('file_get_contents')) {
    $opts = array(
          'http'=>array(
        'method'=>"GET",
        'header'=>$Header,
          )
    );
        $cxContext = stream_context_create($opts);
        $file_contents = @file_get_contents($Url, false, $cxContext);
    } elseif ($Method === 'c'&&function_exists('curl_init')) {
    $Ch = curl_init();
    $Timeout = 5;
        curl_setopt($Ch,CURLOPT_HTTPHEADER,$Header);
        curl_setopt ($Ch, CURLOPT_URL, $Url);
        curl_setopt ($Ch, CURLOPT_RETURNTRANSFER,1);
        curl_setopt ($Ch, CURLOPT_CONNECTTIMEOUT, $Timeout);
    $file_contents = curl_exec($Ch);
    curl_close($Ch);
    }
    //為了讓樣式顯示得漂亮,我們給它加一句目標引向.
    $file_contents = str_replace('</title>',"</title>/n<base href=/"http://{$Urlarr['host']}//" />",$file_contents);
    //處理最常見的幾種編碼, 如果目標網站沒有編碼, 就默認為GBK
    !    function_exists('mb_convert_encoding') && $file_contents = mb_convert_encoding($file_contents,empty($Charset)?'UTF-8':$Charset,$lang[1]);
    //注銷部分代碼;
    unset($Url,$lang,$Timeout,$Urlarr,$Charset);
    return $file_contents;
    }
   
//測試開始 測試用file_get_contents方式
HEADER("CONTENT-TYPE:TEXT/HTML; CHARSET=UTF-8");
//http://www.xtzj.com/read-htm-tid-347550.html  這是采集不到.
$file = get_url_content("
);
$file = str
$link = $link[1];

//我們來模擬獲得數據. 自己更換數字.0-151  下面是用curl方式
$x = 10;
$file = get_url_content($link[$x]);
echo $file;
?>

全部寫上說明,  注釋..

有不明白的回復..   我來給采集普及一下知識.

原文地址:http://bbs.phpchina.com/viewthread.php?tid=99263


發表評論 共有條評論
用戶名: 密碼:
驗證碼: 匿名發表
主站蜘蛛池模板: 图木舒克市| 毕节市| 谢通门县| 射阳县| 微博| 岳普湖县| 凌海市| 嵊泗县| 宁强县| 莆田市| 微山县| 色达县| 鄂伦春自治旗| 二连浩特市| 和林格尔县| 张家界市| 泸州市| 屯昌县| 虹口区| 镇坪县| 山东省| 沙河市| 淮阳县| 中卫市| 通辽市| 南康市| 大埔区| 冕宁县| 钟山县| 噶尔县| 洛浦县| 新化县| 武邑县| 和静县| 海盐县| 共和县| 谷城县| 兴业县| 新晃| 万州区| 遂川县|