CURL抓取网页内容并用正则提取。

最新推荐文章于 2021-03-24 14:52:54 发布

少年强则国强

最新推荐文章于 2021-03-24 14:52:54 发布

阅读量1.1w

点赞数 2

CC 4.0 BY-SA版权

分类专栏： php

本文链接：https://blog.csdn.net/qq435792305/article/details/8502027

php 专栏收录该内容

2 篇文章

订阅专栏

本文介绍了一种使用PHP实现的CURL网页抓取方法，并展示了如何利用正则表达式从抓取的网页中提取特定信息。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

<?php
header("Content-Type:text/html;charset=UTF-8");
/*
 * CURL网页抓取
 * */
class Curl{
    var $setopt;
    var $data;
    function __construct($url){
        $this->setopt =array(
    CURLOPT_URL => "$url",
    CURLOPT_RETURNTRANSFER => true,
    CURLOPT_FOLLOWLOCATION => true,
);
    }
    function exec(){
        $ch = curl_init();
        curl_setopt_array($ch,$this->setopt);
        $this->data = curl_exec($ch);
        curl_close($ch);
        return $this->data;
    }
};
/*
 * 抓取回来的网页进行正则查找
 * id是按ID查找内容
 * tagName是标签查找
 * className按类名查找*/
class Preg{
    function id($data,$id){
        preg_match('/<(.*)\s*id=.*('.$id.').*>\s*(.*)\s*<\/(.*)>/',$data,$str);
        return $str[0];
    }
    
    function tagName($data,$tag){
        preg_match('/<'.$tag.'.*>\s*(.*)\s*<\/'.$tag.'>/',$data,$str);
        return $str[1];
    }
    
    function className($data,$class){
        preg_match('/<(.*)\s*class=.*('.$class.').*>\s*(.*)\s*<\/(.*)>/',$data,$str);
        return $str[0];
    }
    
}

$c = new Curl('www.corker.cc');
$data = $c->exec();
$data = @iconv("gb2312", "utf-8",$data);
$preg = new Preg();
echo $preg->tagName($data,'title');

?>