BeautifulSoup 是一个用于解析 HTML 和 XML 文档的 Python 库,它为开发者提供了一种简单的方式来查找、遍历和修改文档树。BeautifulSoup 特别擅长处理不规则或格式不佳的标记语言,可以自动更正无效的 HTML,因此在网页抓取(Web Scraping)中非常受欢迎。
- 易于使用:提供了直观的方法来导航、搜索和修改解析树。
- 容错性强:能够处理有缺陷的 HTML,并尝试生成最可能的解析结果。
- 多种解析器:支持 Python 标准库中的 HTML 解析器,以及第三方解析器如 lxml 和 html5lib。
- 链式调用:可以通过连续调用方法来构建查询,使得代码更加简洁和易读。
你可以通过 pip 安装 BeautifulSoup:
如果需要安装额外的解析器,比如 lxml 或 html5lib,也可以通过 pip 安装:
下面是一个简单的例子,展示如何使用 BeautifulSoup 来解析 HTML 内容并提取信息:
lxml内核解析本地文件:
lxml内核解析网络文件:
BeautifulSoup 提供了多种方法来寻找文档中的元素:
- :查找所有符合条件的标签。
- :查找第一个符合条件的标签。
- :使用 CSS 选择器来查找元素。
- 和 :向上查找父级标签。
- 和 :查找后面的兄弟标签。
- 和 :查找前面的兄弟标签。
返回的是一个列表 并且返回了所有的a标签
属性选择器—通过属性来寻找对应的标签
层级选择器/后代选择器
获取节点内容
如果标签对象中 只有内容 那么string和get_text()都可以使用,如果标签对象中 除了内容还有标签 那么string就获取不到数据 ,而get_text()是可以获取数据
我们一般情况下 推荐使用get_text()。
节点的属性