爬虫实战手把手教你用Python爬虫(附详细源码)_爬虫源码(1)_行业动态_行情

爬虫实战手把手教你用Python爬虫(附详细源码)_爬虫源码(1)

2024-12-30 00:18 浏览:72

什么是爬虫？

实践来源于理论，做爬虫前肯定要先了解相关的规则和原理，要知道互联网可不是法外之地，你一顿爬虫骚操作搞不好哪天就…

首先，咱先看下爬虫的定义：网络爬虫（又称为网页蜘蛛，网络机器人，在FOAF社区中间，更经常的称为网页追逐者），是一种按照一定的规则，自动地抓取万维网信息的程序或者脚本。一句话概括就是网上信息搬运工。

我们再来看下爬虫应该遵循的规则：robots协议是一种存放于网站根目录下的ASCII编码的文本文件，它通常告诉网络搜索引擎的漫游器（又称网络蜘蛛），此网站中的哪些内容是不应被搜索引擎的漫游器获取的，哪些是可以被漫游器获取的。一句话概括就是告诉你哪些东西能爬哪些不能爬。

了解了定义和规则，最后就是熟悉爬虫的基本原理了，很简单，作为一名灵魂画手，我画个示意图给你看下就明白了。

(⊙o⊙)…尴尬，鼠标写字咋这么丑，都不好意思说自己学过书法，好一个脸字打得呱呱响。

项目背景

理论部分差不多讲完了，有些小朋友估计要嫌我啰嗦了，那就不废话，直接讲实操部分。本次爬虫小项目是应朋友需求，爬取中国木材价格指数网中的红木价格数据，方便撰写红木研究报告。网站长这样：

所需字段已用红框标记，数据量粗略看了下，1751页共5万多条记录，如果你妄想复制粘贴的话，都不知道粘到猴年马月了。而python只要运行几分钟就能把所有数据保存到你的excel里，是不是很舒服？

在这里插入图片描述项目实战

工具：PyCharm

Python版本：Python 3.7

浏览器：Chrome (推荐)

对于第一次写爬虫的朋友可能觉得很麻烦，咱不慌，由浅入深，先爬一页数据试试嘛。

一.爬取一页

首先，我们需要简单分析下网页结构，鼠标右键点击检查，然后点击Network，刷新网页，继续点击Name列表中的第一个。我们发现此网站的请求方式为GET，请求头Headers反映用户电脑系统、浏览器版本等信息。

接着，把爬虫所需的库都pip安装一下并导入，所有库的功能都有注释。

构造请求url，添加头部信息headers即复制前文标记的User-Agent，通过requests.get方法向服务器发送请求，返回html文本。添加headers目的在于告诉服务器，你是真实的人在访问其网站。如果你不添加headers直接访服务器，会在对方服务器显示python在访问，那么，你很可能会被反爬，常见的反爬就是封你ip。

我们运行下以上代码，看下效果：

看到这个，第一次接触爬虫的朋友可能会有点懵。

其实这就是网页源代码，咱们右键打开下源代码看一哈。

长这样：

而我们需要提取的数据，就潜藏在这网页源代码中，我们要用lxml库中的etree方法解析下网页。

parse = etree.HTML(html) #解析网页

解析完之后，就可以开开心心的提取我们所需要的数据了。方法很多，比如xpath、select、beautiful soup，还有最难的re(正则表达式)。本文爬取的数据结构较为简单，就直接用xpath玩一下吧。

我们发现，每一行数据对应源码里的一个id=173200的tr，那就先把这些tr都提取下来。

all_tr = parse.xpath(‘//*[@id=“173200”]’)

有些小伙伴不会写xpath。

那就找个简单办法，直接copy所需的xpath。

所有tr都提取下来了，接下来就得依次从tr里面提取具体字段了。比如提取商品名称字段，点开第一个tr，选中商品，copy其xpath。其他字段同理。

以下要注意几点，tr={key1 : value1, key2 : value2 }是python的字典数据类型（你也可以根据自己兴趣或需要存为列表或元组类型）。‘’.join是指把获取到的列表转为字符串。https://blog.csdn.net/2401_84140687/article/details/是指继承前面的//*[@id=“173200”]，strip()表示对提取的数据进行简单的格式清洗。

咱们打印一下print(tr)，看下效果。

但还没完，数据有了，咱们还得保存csv格式到本地，这一步比较简单，直接贴代码。

打开下刚生成的wood.csv，长这样：

二.爬取多页

别开心的太早，你还仅仅是爬了一页数据，人家复制粘贴都比你快。咱们的志向可不在这，在诗和远方，哦不，是秒速爬海量数据。

那么，怎么才能爬取多页数据呢？没错，for循环。

我们再回过头来分析下url：

http://yz.yuzhuprice.com:8003/findPriceByName.jspx?page.curPage=1&priceName=%E7%BA%A2%E6%9C%A8%E7%B1%BB

我们把里面的page.curPage改成2试试，如下：

你也许发现玄机，只要改变page.curPage就可以实现翻页。OK，那我们直接在url前面加个循环就好啦。format(x)是一种格式化字符串的函数，可以接受不限个数的参数。

至此，你只要改变range想爬多少页就爬多少页，开不开心？意不意外？

三.完善爬虫

如果仅仅按照以上代码爬虫，很有可能爬了十几页程序就崩了。我就多次遇到过中途报错，导致爬虫失败的情况。好不容易写出的爬虫，怎么说崩就崩呢。

报错原因就很多了，玩爬虫的都知道，调试bug是很麻烦的，需要不断试错。这个爬虫的主要bug是TimeoutError。因此，我们需要进一步完善代码。

首先，要将以上代码封装成函数，因为不用函数有以下缺点：

1、复杂度增大

2、组织结构不够清晰

3、可读性差

4、代码冗余

5、可扩展性差

其次，在可能出现报错的地方都加上异常处理。即try…except。

做了那么多年开发，自学了很多门编程语言，我很明白学习资源对于学一门新语言的重要性，这些年也收藏了不少的Python干货，对我来说这些东西确实已经用不到了，但对于准备自学Python的人来说，或许它就是一个宝藏，可以给你省去很多的时间和精力。

别在网上瞎学了，我最近也做了一些资源的更新，只要你是我的粉丝，这期福利你都可拿走。

我先来介绍一下这些东西怎么用，文末抱走。

（1）Python所有方向的学习路线（新版）

这是我花了几天的时间去把Python所有方向的技术点做的整理，形成各个领域的知识点汇总，它的用处就在于，你可以按照上面的知识点去找对应的学习资源，保证自己学得较为全面。

最近我才对这些路线做了一下新的更新，知识体系更全面了。

（2）Python学习视频

包含了Python入门、爬虫、数据分析和web开发的学习视频，总共100多个，虽然没有那么全面，但是对于入门来说是没问题的，学完这些之后，你可以按照我上面的学习路线去网上找其他的知识资源进行进阶。

（3）100多个练手项目

我们在看视频学习的时候，不能光动眼动脑不动手，比较科学的学习方法是在理解之后运用它们，这时候练手项目就很适合了，只是里面的项目比较多，水平也是参差不齐，大家可以挑自己能做的项目去练练。

（4）200多本电子书

这些年我也收藏了很多电子书，大概200多本，有时候带实体书不方便的话，我就会去打开电子书看看，书籍可不一定比视频教程差，尤其是权威的技术书籍。

基本上主流的和经典的都有，这里我就不放图了，版权问题，个人看看是没有问题的。

（5）Python知识点汇总

知识点汇总有点像学习路线，但与学习路线不同的点就在于，知识点汇总更为细致，里面包含了对具体知识点的简单说明，而我们的学习路线则更为抽象和简单，只是为了方便大家只是某个领域你应该学习哪些技术栈。

（6）其他资料

还有其他的一些东西，比如说我自己出的Python入门图文类教程，没有电脑的时候用手机也可以学习知识，学会了理论之后再去敲代码实践验证，还有Python中文版的库资料、MySQL和HTML标签大全等等，这些都是可以送给粉丝们的东西。

这些都不是什么非常值钱的东西，但对于没有资源或者资源不是很好的学习者来说确实很不错，你要是用得到的话都可以直接抱走，关注过我的人都知道，这些都是可以拿到的。

网上学习资料一大堆，但如果学到的知识不成体系，遇到问题时只是浅尝辄止，不再深入研究，那么很难做到真正的技术提升。

需要这份系统化学习资料的朋友，可以戳这里无偿获取

以上就是本篇文章【爬虫实战手把手教你用Python爬虫(附详细源码)_爬虫源码(1)】的全部内容了，欢迎阅览！文章地址：http://w.yusign.com/quote/8325.html
行业资讯企业新闻行情企业黄页同类资讯网站地图返回首页述古往 http://w.yusign.com/mobile/ , 查看更多

什么是爬虫？

项目背景

在这里插入图片描述 项目实战

二.爬取多页

三.完善爬虫

在这里插入图片描述项目实战