查看: 1578|回复: 0

python beautiful soup库的超详细用法

[复制链接]
新浪微博达人勋 ku281  实名认证
论坛徽章:
14
Docker徽章
日期:2016-06-02 10:33:41Web课程徽章
日期:2018-08-14 10:40:00Kafka徽章
日期:2018-08-03 13:41:04Agile徽章
日期:2017-12-25 17:26:41JS课程徽章
日期:2017-11-09 17:11:09spring徽章
日期:2017-07-11 14:27:59JVM徽章
日期:2017-03-23 17:42:46Java徽章
日期:2017-01-06 10:54:24架构徽章
日期:2016-12-29 16:31:50Oracle研习者初级
日期:2016-11-10 14:49:56数据展示徽章
日期:2016-09-08 11:07:46Java徽章
日期:2016-09-01 10:00:53
发表于 2018-10-30 17:40 | 显示全部楼层 |阅读模式

tm Python 工具 编码

详细的参见:https://blog.csdn.net/love666666shen/article/details/775123531. Beautiful Soup 简介

简单来说,Beautiful Soup是python的一个库,最主要的功能是从网页抓取数据。官方解释如下:

Beautiful Soup提供一些简单的、python式的函数用来处理导航、搜索、修改分析树等功能。它是一个工具箱,通过解析文档为用户提供需要抓取的数据,因为简单,所以不需要多少代码就可以写出一个完整的应用程序。Beautiful Soup自动将输入文档转换为Unicode编码,输出文档转换为utf-8编码。你不需要考虑编码方式,除非文档没有指定一个编码方式,这时,Beautiful Soup就不能自动识别编码方式了。然后,你仅仅需要说明一下原始编码方式就可以了。Beautiful Soup已成为和lxml、html6lib一样出色的python解释器,为用户灵活地提供不同的解析策略或强劲的速度。


2. Beautiful Soup 安装

Beautiful Soup 3 目前已经停止开发,推荐在现在的项目中使用Beautiful Soup 4,不过它已经被移植到BS4了,也就是说导入时我们需要 import bs4 。所以这里我们用的版本是 Beautiful Soup 4.3.2 (简称BS4),另外据说 BS4 对 Python3 的支持不够好,不过我用的是 Python2.7.7,如果有小伙伴用的是 Python3 版本,可以考虑下载 BS3 版本。

可以利用 pip 或者 easy_install 来安装,以下两种方法均可




  • easy_install beautifulsoup4



  • pip install beautifulsoup4


如果想安装的版本,请直接下载安装包来手动安装,也是十分方便的方法。下载完成之后解压,运行下面的命令即可完成安装

sudo python setup.py install然后需要安装 lxml


  • easy_install lxml



  • pip install lxml


另一个可供选择的解析器是纯Python实现的 html5lib , html5lib的解析方式与浏览器相同,可以选择下列方法来安装html5lib:


  • easy_install html5lib




回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册 新浪微博登陆

本版积分规则

 

GMT+8, 2019-10-18 11:51 , Processed in 0.116782 second(s), 29 queries .