学完了爬网页中的文本,明天咱们来试着学习爬图片。指标网址:http://www.netbian.com/
咱们的指标就是爬取这些壁纸
关上网址 查看网页构造(保举学习:Python视频教程)
用火狐阅读器关上链接 F12查看
因为我应用的pyquery
能够看到图片的链接 都正在img标签的src属性中 咱们只需经过pyquery锁定到这个img标签 就能够持续下一步了
咱们先来测验考试抓取一页的壁纸碰运气
上面是详细的代码:
#!/usr/bin/env python # -*- coding: utf-8 -*- # @Time : 2018/10/31 17:54 # 爬取图片 import requests from pyquery import PyQuery as pq import time headers = { 'User-Agent': 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_11_4) AppleWebKit/537.36 ' '(KHTML, like Gecko) Chrome/52.0.2743.116 Safari/537.36' } # 这里我应用了代办署理 你能够去掉这个代办署理IP 我是为了前面年夜规模爬取做预备的 proxies = { 'https': '218.75.69.50:39590' } # 申请网页 猎取源码 def start_request(url): r = requests.get(url, headers=headers, proxies=proxies) # 这个网站页面应用的是GBK编码 这里进行编码转换 r.encoding = 'GBK' html = r.text return html # 解析网页 猎取图片 def parse(text): doc = pq(text) # 锁定页面中的img标签 images = doc('div.list ul li img').items() x = 0 for image in images: # 猎取每一一张图片的链接 img_url = image.attr('src') # 取得每一张图片的二进制内容 img = requests.get(img_url, headers=headers, proxies=proxies).content # 界说要存储图片的路劲 path = "F:\\image\\" + str(x) + ".jpg" # 将图片写入指定的目次 写入文件用"wb" with open(path, 'wb') as f: f.write(img) time.sleep(1) print("在下载第{}张图片".format(x)) x += 1 print("写入实现") def main(): url = "http://www.netbian.com" text = start_request(url) parse(text) if __name__ == "__main__": main()
更多Python相干技巧文章,请拜访Python教程栏目进行学习!
以上就是python怎样爬图片的具体内容,更多请存眷资源魔其它相干文章!
标签: Python python教程 python编程 python使用问题
版权声明:除非特别标注,否则均为本站原创文章,转载时请以链接形式注明文章出处。
抱歉,评论功能暂时关闭!