Python爬虫简单实现Q乐园图片下载-FreeNAS中文网

admin 管理员组

文章数量: 887007

Python爬虫简单实现Q乐园图片下载

据需求写代码实现。然而跟我并没有什么关系，我只是打开电脑望着屏幕想着去干点什么，于是有了这个所谓的“需求”。

终于，我发现了Q乐园——到底是我老了还是我小了，这是什么神奇的网站，没听过啊，就是下面酱紫儿——

（虽然小广告有点多，一度以为这并不是什么“正经”的网站...）

我并不是二次元，只是觉得动漫图片还算是“老少皆宜”（“少儿不宜”多尴尬），就决定爬一下动漫图片好了。就是下面那个样子：

鼠标右键——查看源代码，别问我用得什么浏览器。网页大概就是下面这个样：

我好像看到了图集名称，“窗外繁华盛开”（窗内我一口老血），“你已经有别的小朋友了我自己回家就好啦”（说好的老少皆宜，已经隐隐感受了到了早*的味道）

点开一个图集，看下“窗外繁华盛开”吧，还算美~

然后我们还是右键查看源代码（说了不告诉你我用的什么浏览器）——

里面的“”就是图集中图片对应的地址了，比如.jpeg!600x600.jpg，直接复制到浏览器中打开就是图片了——不信试试！

所以，我们要下载图片，其实也就是要拿到这些网址。怎么拿？正则表达式，华丽登场！

就比如，我们如果打开了图集“窗外繁华盛开”，那就可以直接爬取图集中图片的地址了，这一个图集就搞定了。如果我们贪得无厌，想要下载更多图集的图片怎么办？（请依次打开图集，然后把鼠标放在图片上，右键图片另存为——啊，当然是开玩笑的了，毕竟我这么懒！）

所以呢，我们还要获取所有图集的网址。基本思路就是：打开一个图集网址——获取图片链接——图片下载——打开下一个图集网址——（这不是废话吗？）

那么，如何获取所有图集网址呢？

其实，我们第一次查看源代码的时候提到，好像已经看到了图集的名称，是的，图集的名称，再回头去看看，里面的确已经包含了图集的网址和名称了。举个栗子：

/haokan/dongman/1349139.html" target="_blank">窗外繁花盛开</h5>

这一行里，/haokan/dongman/1349139.html这部分对应的就是网址，名称自己看。

好了，和获取图片网址一样，爬呗，反正我们有个不怕累的虫子（啊？虫子又是什么？我是谁？我在哪里？我在干什么？）

现在我们看到的是第一页，如果我们还想下载第二页、第三页、...所有页面的图集怎么办？（下载了有啥用？大概有病）

看来我们只好手动一个一个页面的打开，然后“放虫咬图”！（pi~）

好吧，还是偷懒一下好了。反正我们就是下载Q乐园（高端大气上档次！）中的动漫图片，我们发现它的网页都是有规律的：比如第一页的网址：/，第二页的网址：.html。我猜第三页的网址是：.html（麻德，我好聪明怎么办？！）

于是网址我们可以通过列表的方式构造了。（列表！终于听到了一个正常的词儿，但其实我，根本没用到好吗啊啊啊啊）

所以，思路很简单了，我们先构造所有页面的网址集合，对每个页面网址爬取该页面上图集的网址，然后从图集的网址上爬取该图集包含的图片的网址，然后下载图片。（感觉好轻松！其实就是好轻松）

有几个小tips：

1.我不想把所有图片都扔到一个文件夹中，我想按照图集的名称分别创建文件夹，然后分别保存。怎么办？爬取图集名称创建文件夹呗~

2.图集名称中包含特殊字符，创建文件夹时很可能会因命名问题出错，那么怎么办？随便吧。。。我就随便一搞，差不多就行。

3.我发现页面源代码中没有包含一共多少页面，那么我们怎么判断一共要抓去多少页面呢？我猜大概不会出现.html，一万页，这渣网，下到啥时候啊。嗯，还是随便吧，我就是随便一搞，真的差不多就行

4.如果有一张图片，或者有一个网页卡了，就是下载不下来或者打不开了怎么办？随便搞搞吧，定个时间，没反应劳资还不看了，跳过！

5.如果图集重复了，我想下载到同一个文件夹中，还不想覆盖原有的图片怎么办？我猜你肯定知道随便搞搞就行，你比我聪明！

6.我忘记了...

看我“自由派”的代码吧，大概会编程的人都受不了，框架结构什么的随便了，反正我乐意（斜眼）。直接跳过V1.0，V2.0，看V3.0吧！（建议V3.0也不用看，啥用啊）

那么，下载了图集长什么样子呢？

先看下下载过程大概长什么样子（其实根本没有过程）：

下载后部分文件夹：

看看“窗外繁华盛开”，图片是什么样子：

本文标签： Python爬虫简单实现Q乐园图片下载

版权声明：本文标题：Python爬虫简单实现Q乐园图片下载内容由网友自发贡献，该文观点仅代表作者本人，转载请联系作者并注明出处：http://www.freenas.com.cn/jishu/1732360177h1534991.html，本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。如发现本站有涉嫌抄袭侵权/违法违规的内容，一经查实，本站将立刻删除。

技术交流 – FreeNAS中文网

Python爬虫简单实现Q乐园图片下载

Python爬虫简单实现Q乐园图片下载

更多相关文章

Python爬虫简单实现Q乐园图片下载

发表评论

推荐文章

win10-忘记密码后用老毛桃去掉密码

windows中安装sqlite

[.net 面向对象编程基础] (19)LINQ基础

Java集合源码剖析——基于JDK1.8中HashMap的实现原理

Java 字符串正则表达式

热门文章

U盘装系统，使用U盘启动，提示需要装驱动

在 VMware 虚拟机中轻松安装 Windows 7 精简版系统

windows如何安装并切换不同版本的cuda，更新cuda版本

Windows系统ping不通同网段主机解决方法

windows文件自动同步

如何在VirtualBox中启用3D加速和使用Windows Aero

ensp基于三层交换机或路由器实现直连网络（不同网段）用户之间的互联互通

nvme装系统不能自引导_换个玩法就不会了？NVME固态硬盘就是这样装系统的

电脑垃圾清理怎样最干净？献上五招保你电脑干净顺畅！

windows系统下更新nodejs

最新文章

Raid技术

LSI_阵列卡操作手册

破解Centos7_root用户密码

Redhat重置Root用户密码方法

远程批量修改linux服务器密码的脚本

win7计算机管理中看不到新加的硬盘,win7系统看不到第二块硬盘的解决方法.

[转]笔记本电脑处理器(CPU)性能排行榜

project安装包的下载和安装教程

测试模式 windows2008 内部版本7601

如何区分自己的windows系统是正版还是盗版？从零基础到精通，收藏这篇就够了！

技术交流 – FreeNAS中文网

Python爬虫简单实现Q乐园图片下载

Python爬虫简单实现Q乐园图片下载

更多相关文章

Python爬虫简单实现Q乐园图片下载

发表评论

推荐文章

win10-忘记密码后用老毛桃去掉密码

windows中安装sqlite

[.net 面向对象编程基础] (19)LINQ基础

Java集合源码剖析——基于JDK1.8中HashMap的实现原理

Java 字符串 正则表达式

热门文章

U盘装系统，使用U盘启动，提示需要装驱动

在 VMware 虚拟机中轻松安装 Windows 7 精简版系统

windows如何安装并切换不同版本的cuda，更新cuda版本

Windows系统ping不通同网段主机解决方法

windows文件自动同步

如何在VirtualBox中启用3D加速和使用Windows Aero

ensp基于三层交换机或路由器实现直连网络（不同网段）用户之间的互联互通

nvme装系统不能自引导_换个玩法就不会了？NVME固态硬盘就是这样装系统的

电脑垃圾清理怎样最干净？献上五招保你电脑干净顺畅！

windows系统下更新nodejs

最新文章

Raid技术

LSI_阵列卡操作手册

破解Centos7_root用户密码

Redhat重置Root用户密码方法

远程批量修改linux服务器密码的脚本

win7计算机管理中看不到新加的硬盘,win7系统看不到第二块硬盘的解决方法.

[转]笔记本电脑处理器(CPU)性能排行榜

project安装包的下载和安装教程

测试模式 windows2008 内部版本7601

如何区分自己的windows系统是正版还是盗版 ？从零基础到精通，收藏这篇就够了！

Java 字符串正则表达式

如何区分自己的windows系统是正版还是盗版？从零基础到精通，收藏这篇就够了！