零基础学Python网络爬虫案例实战全流程详解(高级进阶篇)

1星价 ¥65.6 (7.3折)

2星价￥65.6 定价￥89.8

作者：王宇韬,吴子湛,史靖涵

出版社：机械工业出版社

本类榜单：计算机/网络

分类：计算机/网络 > 程序设计

暂无评论

图文详情

ISBN：9787111684749
装帧：一般胶版纸
册数：暂无
重量：暂无
开本：16开
页数：272
出版时间：2021-06-01
条形码：9787111684749 ; 978-7-111-68474-9

本书特色

Cookie模拟登录+验证码识别+Ajax动态请求破解宝突破反爬机制,Scrapy+Flask搭建商业项目

内容简介

在这个数据为王的时代，无论是从事何种行业，每天都会与海量的且各种类型的数据打交道，如何从这些数据中获取需要的信息，并进行相应的分析和可视化展示，是很多程序员和职场人士很好关心的一个问题。本书以功能强大且上手操作容易的Python语言为基础，主要讲解Python爬虫的不错进阶技巧，主要侧重于各种应对网站反爬的相关技巧、爬虫框架、爬虫服务器部署等相关知识点。本书共分8章，核心主题包括如何通过Cookie模拟登录网站从而解决网站反爬问题，如何通过进行验证码反爬识别，如何破解Ajax动态请求，讲解Webdriver拦截等其他反爬手段识别，如何进行手机APP爬虫，Scrapy爬虫框架，如何利用Scrapy爬虫框架应对反爬，爬虫的云服务器部署等。此外，书中对实际案例进行分析，让读者更好地理解和掌握爬虫知识。本书适合各行各业的数据分析从业人员学习，也适合想要提高工作效率的职场人士，对于Python编程感兴趣的读者，本书也是一本不错的参考读物。

前言本书学习资源第1章 Cookie模拟登录 1.1 Cookie模拟登录的原理 11 1.1.1 客户端与服务端 11 1.1.2 HTTP的无状态性 12 1.1.3 Cookie的含义与作用 13 1.1.4 Session的含义与作用 16 1.1.5 Cookie与Session的交互 17 1.2 案例实战1：模拟登录淘宝并爬取数据 20 1.2.1 获取Cookie模拟登录淘宝 20 1.2.2 爬取淘宝商品数据 25 1.3 案例实战2：模拟登录新浪微博并爬取数据 29 1.3.1 获取Cookie模拟登录新浪微博 30 1.3.2 爬取新浪微博热搜榜信息 34 课后习题 38 第2章验证码反爬的应对 2.1 图像验证码 39 2.1.1 超级鹰平台注册 40 2.1.2 超级鹰Python接口的使用 41 2.1.3 案例实战：英文验证码和中文验证码识别 46 2.2 计算题验证码 51 2.3 滑块验证码 54 2.4 滑动拼图验证码 57 2.4.1 初级版滑动拼图验证码 59 2.4.2 高级版滑动拼图验证码 63 2.5 点选验证码 68 2.5.1 本地网页识别 69 2.5.2 bilibili点选验证码识别初探 75 2.5.3 bilibili点选验证码识别升级：无限尝试版 80 课后习题 85 第3章 Ajax动态请求破解 3.1 Ajax简介 86 3.1.1 不同的网页翻页方式的对比 86 3.1.2 Ajax的基本概念与工作原理 88 3.2 案例实战1：爬取开源中国博客频道 89 3.2.1 分析Ajax请求 89 3.2.2 爬取单页博客 92 3.2.3 爬取多页博客 96 3.3 案例实战2：爬取新浪微博 98 3.3.1 模拟登录新浪微博 100 3.3.2 分析单个微博页面 101 3.3.3 破解Ajax请求爬取多页 103 课后习题 108 第4章手机App内容爬取 4.1 相关软件安装 109 4.1.1 安装夜神模拟器 110 4.1.2 安装Node.js 111 4.1.3 安装JDK 113 4.1.4 安装Android Studio 117 4.1.5 安装Appium 118 4.1.6 安装Appium-Python-Client库 118 4.2 手机模拟操作初步尝试 119 4.2.1 用Android Studio连接夜神模拟器 119 4.2.2 用Python连接微信App 121 4.3 Appium基本操作与进阶操作 123 4.3.1 Appium基本操作 123 4.3.2 Appium进阶操作 126 4.4 案例实战：爬取微信朋友圈内容 132 4.4.1 获取微信朋友圈页面源代码 133 4.4.2 提取微信朋友圈内容 135 4.5 多开模拟器打开多个微信 138 4.5.1 多开模拟器 138 4.5.2 用Appium连接多个模拟器 139 课后习题 143 第5章 Scrapy爬虫框架 5.1 Scrapy框架基础 144 5.1.1 Scrapy的安装方法 144 5.1.2 Scrapy的整体架构 146 5.1.3 Scrapy的常用指令 148 5.2 案例实战1：百度新闻爬取 156 5.2.1 Robots协议破解 157 5.2.2 User-Agent设置 158 5.2.3 百度新闻标题爬取 159 5.3 案例实战2：新浪新闻爬取 160 5.3.1 实体文件设置 161 5.3.2 新浪新闻爬取：爬取一条新闻 162 5.3.3 新浪新闻爬取：爬取多条新闻 166 5.3.4 新浪新闻爬取：生成文本文件报告 167 5.4 案例实战3：豆瓣电影海报图片爬取 170 5.4.1 用常规方法爬取 170 5.4.2 用Scrapy爬取 171 5.5 知识拓展：Python类的相关知识 176 5.5.1 类和对象的概念 176 5.5.2 类名、属性和方法 176 5.5.3 类的进阶知识 179 课后习题 182 第6章 Scrapy应对反爬 6.1 中间件技术概述 183 6.1.1 下载器中间件 184 6.1.2 爬虫中间件 184 6.2 Scrapy+IP代理：爬取搜狗图片 185 6.2.1 用Requests库批量下载图片 186 6.2.2 用Scrapy框架批量下载图片 198 6.3 Scrapy+Cookie：模拟登录淘宝 202 6.3.1 在中间件文件中添加Cookie 202 6.3.2 编写并运行爬虫文件：爬取淘宝网页 204 6.4 Scrapy+Selenium库：爬取**财经新闻 206 6.4.1 在中间件文件中添加Selenium库 207 6.4.2 编写并运行爬虫文件：爬取新闻信息 209 课后习题 214 第7章爬虫云服务器部署 7.1 HTML网页制作进阶 215 7.1.1 表格 217 7.1.2 列表 218 7.1.3 样式设计 220 7.1.4 背景设置 228 7.2 Flask Web编程基础 232 7.2.1 Flask入门 232 7.2.2 用render_template()函数渲染页面 237 7.2.3 用Flask连接数据库 242 7.3 Flask Web编程实战 247 7.3.1 展示单家公司的数据 247 7.3.2 展示多家公司的数据 252 7.3.3 展示舆情评分 255 7.3.4 只展示当天新闻 257 7.3.5 只展示负面新闻 258 7.4 云服务器的购买和登录 261 7.5 程序云端部署及网站搭建 265 7.5.1 搭建程序的运行环境 265 7.5.2 程序24小时运行及Flask项目部署 266 7.5.3 域名申请和使用 267 课后习题 270

展开全部

作者简介

王宇韬（CFA、FRM、AQF）华能贵诚信托金融科技实验室发起人，宾夕法尼亚大学硕士，上海交通大学学士，曾在剑桥大学交流学习，两年内通过CFA 3级、FRM 2级、AQF。在华能贵诚信托自主研发了舆情监控系统、资金雷达、流程自动化AI系统、机器视频面试系统等；专注于科技在金融领域的应用，编著有《Python金融大数据挖掘与分析全流程详解》和《Python大数据分析与机器学习商业案例实战》。吴子湛毕业于合肥工业大学计算机学院，就职于南京市秦淮区大数据中心，拥有多年IT 研发经验，擅长大数据分析与挖掘。史靖涵北京邮电大学计算机专业学士，帝国理工大学和加州大学伯克利分校计算机专业硕士，擅长分布式爬虫与数据挖掘。

本类五星书