使用wget工具抓取网页和图片及相关工具几个

想保存一些网页，最后找到这 wget 的 shell脚本,虽然不是太理想，亲测可用呢。

使用wget工具抓取网页和图片   来源 https://my.oschina.net/freestyletime/blog/356985

#!/bin/sh
URL="$2"
PATH="$1"
echo "download url: $URL"
echo "download dir: $PATH"
/usr/bin/wget -e robots=off -w 1 -xq -np -nH -pk -m -t 1 -P "$PATH" "$URL"
echo "success to download"

脚本的使用方法 ./wget_cc ./download http://www.baidu.com

需要注意的是，我的wget是在/usr/bin目录下（这里必须写全路径），你可以使用which wget这个命令确定你的wget路径所在，然后替换到脚本中就行了。

这里多加了几个参数，解释一下：
-e 用法是‘-e command’
    用来执行额外的.wgetrc命令。就像vim的配置存在.vimrc文件中一样，wget也用.wgetrc文件来存放它的配置。也就是说在wget执行之前，会先执行.wgetrc文件中的配置命令。一个典型的.wgetrc文件可以参考：
    http://www.gnu.org/software/wget/manual/html_node/Sample-Wgetrc.html
    http://www.gnu.org/software/wget/manual/html_node/Wgetrc-Commands.html
    用户可以在不改写.wgetrc文件的情况下，用-e选项指定额外的配置命令。如果想要制定多个配置命令，-e command1 -e command2 ... -e commandN即可。这些制定的配置命令，会在.wgetrc中所有命令之后执行，因此会覆盖.wgetrc中相同的配置项。

    这里robots=off是因为wget默认会根据网站的robots.txt进行操作，如果robots.txt里是User-agent: * Disallow: /的话，wget是做不了镜像或者下载目录的。
    这就是前面为什么下载不了图片和其他资源的原因所在了，因为你要爬的HOST禁止蜘蛛去爬它，而wget使用 -e robots=off 这个选项可以通过这个命令绕过这个限制。
-x 创建镜像网站对应的目录结构
-q 静默下载，即不显示下载信息，你如果想知道wget当前在下载什么资源的话，可以去掉这个选项
-m 它会打开镜像相关的选项，比如无限深度的子目录递归下载。
-t times 某个资源下载失败后的重试下载次数
-w seconds 资源请求下载之间的等待时间（减轻服务器的压力）
剩下有不懂的你就去挖文档吧。
写好后保存退出，执行：
chmod 744 wget_cc
OK，这样脚本就能直接执行，而不用在每条命令前带 /bin/sh 让sh去解释它了。
下面就让脚本执行起来吧！
./wget_cc ./download http://www.baidu.com
下载完成后的目录结构
OK，然后再查看<img>标签中的src属性，
src="img/bd_logo1.png"
果然换成了相对路径啊，大功告成，觉得对您有帮助的请点个赞吧！

========================= 华丽的分割线之后 =================================
信息收集之网站镜像克隆   资料来源 http://www.sqlsec.com/2016/web.html

使用HTTrack复制克隆网站
介绍
HTTrack是一款免费的离线浏览器工具，和wget克隆复制镜像差不多，从服务器抓取HTML文件、图片、以及其他css文件并存储到你的计算机上。Kali 2.0起默认预装了 HTTrack。
使用方法

终端下输入:

httrack

如果没有安装这个工具的话，那就现场安装一下吧，只需要2个命令:

apt-get update
apt-get install httrack

这里提示要输入项目名称、存放网站的路径（默认为 /root/website）和要克隆的目标站我们这里以搜狗浏览器官网为例
我们自定义输入test 然后按下回车

sougou

然后默认路径回车

```
输入想要克隆的网站

http://ie.sougou.com
`` 下面HTTrack提供了一些选项，我们一般选择第二本选项Mirror Web Site(s) with Wizard（具有向导递归层级的镜像网站）输入:2`
回车回车回车后面的一些基本设置一般一直回车下去直到网站开始克隆为止，HTTrack 就开始进行网站克隆了。

========================= 华丽的分割线之后 =================================
ruby 爬虫 Spidr 用法资料来源 https://my.oschina.net/u/572987/blog/89734

从一个网址开始爬: Spidr.start_at('http://tenderlovemaking.com/')

还有很多，

转载于:https://www.cnblogs.com/yisuo/p/6783982.html

使用wget工具抓取网页和图片及相关工具几个

相关文章

R 安装包

char型指针偏移量_C语言指针学习收获第一阶段

分类技术

#ifdef、#ifndef、#else、#endif执行条件编译

解决AnimationClip.SetCurve RectTransform Color参数出现Missing！的情况

js多方框输入密码_js仿支付宝多方框输入支付密码效果

sharepoint list 设置中column没有排序选项

Docker 更改镜像存储位置

使用wget工具抓取网页和图片 及 相关工具几个

相关文章

使用wget工具抓取网页和图片及相关工具几个