PHP实现远程抓取网站图片并保存在文件中（php怎么上传图片并保存到数据库）-FinClip官网

PHP实现远程抓取网站图片并保存在文件中（php怎么上传图片并保存到数据库）

网友投稿 1099 2022-09-03

PHP实现远程抓取网站图片并保存在文件中（php怎么上传图片并保存到数据库）

这个功能类虽然是PHP原生的，但是也值得你去学习一下的。

递归抓取首页与子页面

/**

* 递归-抓取首页及其子页面图片的方法 ( recursive 递归)

* @param String $capture_url 用于抓取图片的网址

*/ public function recursive_download_images($capture_url) {

if (!in_array($capture_url,self::$a_url_arr)) //没抓取过 {

self::$a_url_arr[]=$capture_url; //计入静态数组 } else //抓取过,直接退出函数 {

return;

}

$this->download_current_page_images($capture_url); //-当前页面的所有图片 //用@屏蔽掉因为抓取地址无法读取导致的warning错误 $content=@file_get_contents($capture_url);

//匹配a标签href属性中?之前部分的正则 $a_pattern = "|]+href=['\" ]?([^ '\"?]+)['\" >]|U";

preg_match_all($a_pattern, $content, $a_out, PREG_SET_ORDER);

$tmp_arr=array(); //定义一个数组,用于存放当前循环下抓取图片的超链接地址 foreach ($a_out as $k => $v)

{

/**

* 去除超链接中的空'','#','/'和重复值

* 1: 超链接地址的值不能等于当前抓取页面的url, 否则会陷入死循环

* 2: 超链接为''或'#','/'也是本页面,这样也会陷入死循环,

* 3: 有时一个超连接地址在一个网页中会重复出现多次,如果不去除,会对一个子页面进行重复-)

*/ if ( $v[1] && !in_array($v[1],self::$a_url_arr) &&!in_array($v[1],array('#','/',$capture_url) ) )

{

$tmp_arr[]=$v[1];

}

foreach ($tmp_arr as $k => $v)

{

//超链接路径地址 if ( strpos($v, 'http://')!==false ) //如果url包含http://,可以直接访问 {

$a_url = $v;

}else //否则证明是相对地址, 需要重新拼凑超链接的访问地址 {

$domain_url = substr($capture_url, 0,strpos($capture_url, '/',8)+1);

$a_url=$domain_url.$v;

}

$this->recursive_download_images($a_url);

}

-当前的所有页面

/**

* -当前网页下的所有图片

* @param String $capture_url 用于抓取图片的网页地址

* @return Array 当前网页上所有图片img标签url地址的一个数组

*/ public function download_current_page_images($capture_url) {

$content=@file_get_contents($capture_url); //屏蔽warning错误 //匹配img标签src属性中?之前部分的正则 $img_pattern = "|]+src=['\" ]?([^ '\"?]+)['\" >]|U";

preg_match_all($img_pattern, $content, $img_out, PREG_SET_ORDER);

$photo_num = count($img_out);

//匹配到的图片数量 echo '

foreach ($img_out as $k => $v)

{

$this->save_one_img($capture_url,$v[1]);

}

保存图片

/**

* 保存单个图片的方法

* @param String $capture_url 用于抓取图片的网页地址

* @param String $img_url 需要保存的图片的url

*/ public function save_one_img($capture_url,$img_url) {

//图片路径地址 if ( strpos($img_url, 'http://')!==false )

{

// $img_url = $img_url; }else {

$domain_url = substr($capture_url, 0,strpos($capture_url, '/',8)+1);

$img_url=$domain_url.$img_url;

}

$pathinfo = pathinfo($img_url); //获取图片路径信息 $pic_name=$pathinfo['basename']; //获取图片的名字 if (file_exists($this->save_path.$pic_name)) //如果图片存在,证明已经被抓取过,退出函数 {

echo $img_url . '该图片已经抓取过!
';

return;

}

//将图片内容读入一个字符串 $img_data = @file_get_contents($img_url); //屏蔽掉因为图片地址无法读取导致的warning错误 if ( strlen($img_data) > $this->img_size ) //-size比限制大的图片 {

$img_size = file_put_contents($this->save_path . $pic_name, $img_data);

if ($img_size)

{

echo $img_url . '图片保存成功!
';

} else {

echo $img_url . '图片保存失败!
';

}

} else {

echo $img_url . '图片读取失败!
';

}

} // END

来看看一个完整的功能类，直接保存，引用就可以了

* 一个用于抓取图片的类

* @package default

* @author WuJunwei

*/ class download_image {

public $save_path; //抓取图片的保存地址 //抓取图片的大小限制(单位:字节) 只抓比size比这个限制大的图片 public $img_size=0;

//定义一个静态数组,用于记录曾经抓取过的的超链接地址,避免重复抓取 public static $a_url_arr=array();

/**

* @param String $save_path 抓取图片的保存地址

* @param Int $img_size 抓取图片的保存地址

*/ public function __construct($save_path,$img_size) {

$this->save_path=$save_path;

$this->img_size=$img_size;

}

/**

* 递归-抓取首页及其子页面图片的方法 ( recursive 递归)

* @param String $capture_url 用于抓取图片的网址

*/ public function recursive_download_images($capture_url) {

if (!in_array($capture_url,self::$a_url_arr)) //没抓取过 {

self::$a_url_arr[]=$capture_url; //计入静态数组 } else //抓取过,直接退出函数 {

return;

}

$this->download_current_page_images($capture_url); //-当前页面的所有图片 //用@屏蔽掉因为抓取地址无法读取导致的warning错误 $content=@file_get_contents($capture_url);

//匹配a标签href属性中?之前部分的正则 $a_pattern = "|]+href=['\" ]?([^ '\"?]+)['\" >]|U";

preg_match_all($a_pattern, $content, $a_out, PREG_SET_ORDER);

$tmp_arr=array(); //定义一个数组,用于存放当前循环下抓取图片的超链接地址 foreach ($a_out as $k => $v)

{

/**

* 去除超链接中的空'','#','/'和重复值

* 1: 超链接地址的值不能等于当前抓取页面的url, 否则会陷入死循环

* 2: 超链接为''或'#','/'也是本页面,这样也会陷入死循环,

* 3: 有时一个超连接地址在一个网页中会重复出现多次,如果不去除,会对一个子页面进行重复-)

*/ if ( $v[1] && !in_array($v[1],self::$a_url_arr) &&!in_array($v[1],array('#','/',$capture_url) ) )

{

$tmp_arr[]=$v[1];

}

foreach ($tmp_arr as $k => $v)

{

//超链接路径地址 if ( strpos($v, 'http://')!==false ) //如果url包含http://,可以直接访问 {

$a_url = $v;

}else //否则证明是相对地址, 需要重新拼凑超链接的访问地址 {

$domain_url = substr($capture_url, 0,strpos($capture_url, '/',8)+1);

$a_url=$domain_url.$v;

}

$this->recursive_download_images($a_url);

}

/**

* -当前网页下的所有图片

* @param String $capture_url 用于抓取图片的网页地址

* @return Array 当前网页上所有图片img标签url地址的一个数组

*/ public function download_current_page_images($capture_url) {

$content=@file_get_contents($capture_url); //屏蔽warning错误 //匹配img标签src属性中?之前部分的正则 $img_pattern = "|]+src=['\" ]?([^ '\"?]+)['\" >]|U";

preg_match_all($img_pattern, $content, $img_out, PREG_SET_ORDER);

$photo_num = count($img_out);

//匹配到的图片数量 echo '

foreach ($img_out as $k => $v)

{

$this->save_one_img($capture_url,$v[1]);

}

/**

* 保存单个图片的方法

* @param String $capture_url 用于抓取图片的网页地址

* @param String $img_url 需要保存的图片的url

*/ public function save_one_img($capture_url,$img_url) {

//图片路径地址 if ( strpos($img_url, 'http://')!==false )

{

// $img_url = $img_url; }else {

$domain_url = substr($capture_url, 0,strpos($capture_url, '/',8)+1);

$img_url=$domain_url.$img_url;

}

echo $img_url . '该图片已经抓取过!
';

return;

}

$img_size = file_put_contents($this->save_path . $pic_name, $img_data);

if ($img_size)

{

echo $img_url . '图片保存成功!
';

} else {

echo $img_url . '图片保存失败!
';

}

} else {

echo $img_url . '图片读取失败!
';

}

} // END set_time_limit(120); //设置脚本的最大执行时间根据情况设置 $download_img=new download_image('E:/images/',0); //实例化-图片对象 $download_img->recursive_download_images('http://oschina-/'); //递归抓取图片方法 //$download_img->download_current_page_images($_POST['capture_url']); //只抓取当前页面图片方法

洞察纵观鸿蒙next版本，如何凭借FinClip加强小程序的跨平台管理，确保企业在数字化转型中的高效运营和数据安全？

1099 2022-09-03

PHP实现远程抓取网站图片并保存在文件中（php怎么上传图片并保存到数据库）

洞察纵观鸿蒙next版本，如何凭借FinClip加强小程序的跨平台管理，确保企业在数字化转型中的高效运营和数据安全？

洞察金融行业需要转型，如何利用鸿蒙app开发提升运营效率

洞察在数字化转型过程中，信创推动企业有效整合资源，实现低成本、高效率的跨平台小程序运营。

最近发表

更多内容

小程序SDK

Finclip技术文档

小程序开发

小程序容器

小程序框架

Finclip小程序平台

Finclip用户投稿

车联网

推荐文章

小程序SDK是什么意思？小程序sdk和插件有什么区别？

小程序支付功能怎么实现？

企业app开发流程是什么？

app运营模式有哪些？

小程序多端引流怎么做？

小程序生态分析的机会和威胁

Flutter入门这一篇效率文章就够了

原生与跨平台解决方案分析,跨平台软件开发技术方案

热更新技术：让软件更新变得更加轻松快速

解决方案

银行解决方案

证券解决方案

互联网解决方案

政企OA解决方案

科技解决方案

loT解决方案

信任解决方案

热评文章

AppCan:基于混合模式的移动应用开发,移动混合模

Hybrid App混合模式开发的了解

小程序容器技术助力券商数字营销突围，小程序容器化的意

用mpvue开发微信小程序基础知识（vue.js开发

小程序多端框架全面测评对比，强烈推荐！

券商app架构 - 解析券商应用程序的构建与设计