Python爬虫批量下载图片

news/2024/7/19 11:04:23 标签: python, 爬虫, 开发语言

一、思路:

        1. 分析URL,图片的URL内嵌于base_url的返回当中

        2. 下载图片

二、代码 

python">import time
import requests
import os
from lxml import etree


class DownloadImg():
    '''
    爬虫进行美女图片下载

    '''
    def __init__(self):
        self.url = 'http://xxxxxx/4kmeinv/'
        self.base_url = 'xxxxxxxxxx'
        self.headers = {
                'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/119.0.0.0 Safari/537.36'
            }
        self.page = 1

    #创建图片存储目录
    def create_img_dir(self):
        current_dir = os.path.dirname(__file__)
        img_dir = os.path.join(current_dir,'img')
        if not os.path.exists(img_dir):
            os.makedirs(img_dir)
        return img_dir

    #下载图片
    def download_img(self,url_list):
        for url in url_list:
            res = requests.get(url=url,headers=self.headers).text
            tree = etree.HTML(res)
            self.create_img_dir()
            #解析
            for li in tree.xpath('//div[@class="slist"]/ul/li'):
                img_url = li.xpath('./a/img/@src')[0]
                full_img_url = self.base_url + img_url
                print(full_img_url)
                img_name = full_img_url.split('/')[-1]
                full_img_name = os.path.join(self.create_img_dir(), img_name)
                # 开始下载图片
                with open(full_img_name, 'wb') as fs:
                    content = requests.get(url=full_img_url, headers=self.headers).content
                    fs.write(content)
                    print("{}图片下载完成 ".format(img_name))
                    time.sleep(1)


    #生成图片URL,返回每个page组成的列表
    def get_img_url(self,page):
        url_list = [self.url]
        if page == 1 :
            return url_list
        elif page > 1 :
            '''
            https://xxxxxxx/index_3.html
            '''
            for i in range(1,page+1):
                if i == 1 :
                    continue
                multi_url = self.url + "index_{}.html".format(str(page))
                url_list.append(multi_url)
            return url_list


if __name__ == '__main__':
    #下载页数,2页
    page = 2
    #定义类对象
    down_img = DownloadImg()
    url = down_img.get_img_url(2)
    print(url)
    down_img.download_img(url)
    print("图片全部下载完成,程序退出")


http://www.niftyadmin.cn/n/5184078.html

相关文章

sqli-labs(Less-4) extractvalue闯关

extractvalue() - Xpath类型函数 1. 确认注入点如何闭合的方式 2. 爆出当前数据库的库名 http://127.0.0.1/sqlilabs/Less-4/?id1") and extractvalue(1,concat(~,(select database()))) --3. 爆出当前数据库的表名 http://127.0.0.1/sqlilabs/Less-4/?id1") …

系列一、JVM的架构图

一、JVM的位置 JVM是运行在操作系统之上的,它与硬件没有直接的交互。 二、JVM的架构图

xstream实现xml和java bean 互相转换

目录 pom引用java bean 类XML 转换工具类测试类执行结果注意问题 JAXB方式见: JAXB实现XML和Bean相互转换 Java中实现XML和Bean的转换的方式或插件有以下几种: JAXB(Java Architecture for XML Binding):JAXB是Java …

构造函数和初始化列表的关系和区别【详解】

构造函数和初始化列表关系和区别,以及为什么有初始化列表,和它的好处 一、构造函数和初始化列表的关系和区别二、为什么有初始化列表三、使用初始化列表的好处 一、构造函数和初始化列表的关系和区别 百度百科这样定义初始化列表:与其他函数…

MR外包团队:MR、XR混合现实技术应用于游戏、培训,心理咨询、教育成为一种创新的各行业MR、XR形式!

随着VR、AR、XR、MR混合现实等技术逐渐应用于游戏开发、心理咨询、培训、教育各个领域,为教育、培训、心理咨询等行业带来了全新的可能性。MR、XR游戏开发、心理咨询是利用虚拟现实技术模拟真实场景,让学生身临其境地参与学习和体验,从而提高…

推介会如何做好媒体宣传

传媒如春雨,润物细无声,大家好,我是51媒体网胡老师。 推介会是一种专为企业、社会组织和团体、政府等提供的展示自身特点、产品和政策的活动形式,旨在促进交流活动,形成合作,从而带来共同利益。推介会的本…

解决:java: 错误: 不支持发行版本 5 最有效方法

报错信息如图&#xff1a; 直接上终极方法&#xff1a; 修改配置文件 如图找到settings.xml文件 在标签中间插入如下代码&#xff08;jdk更改为自己电脑上的版本&#xff09; <profile><id>development</id><activation><jdk>11</jdk><…

阿里云99元VS腾讯云88元,双11云服务器价格战,谁胜谁负?

在2023年的双十一优惠活动中&#xff0c;阿里云推出了一系列令人惊喜的优惠活动&#xff0c;其中包括99元一年的超值云服务器。本文将带您了解这些优惠活动的具体内容&#xff0c;以及与竞争对手腾讯云的价格对比&#xff0c;助您轻松选择最适合的云服务器。 99元一年服务器优…