首页 > > 网络编程 > 其它 >

Python爬虫学习==>第五章：爬虫常用库的…

2018-06-18 02:09:01来源：未知阅读 ()

学习目的：

爬虫有请求库（request、selenium）、解析库、存储库（MongoDB、Redis）、工具库，此节学习安装常用库的安装

正式步骤

Step1：urllib和re库

这两个库在安装Python中，会默认安装，下面代码示例调用：

>>> import urllib
>>> import urllib.request
>>> urllib.request.urlopen("http://www.baidu.com")
<http.client.HTTPResponse object at 0x0000000002F05F60>
>>> import re

导入时，没有回显，就表示安装正确，可以正常使用

Step2：requests库安装

打开windows命令行cmd，输入命令：pip3 install requests

验证安装成功的代码示例

>>> import requests
>>> requests.get("http://www.baidu.com")
<Response [200]>

Step3：selenium库的安装

自动化测试的根基
在cmd中输入命令：pip3 install selenium

测试代码

>>> import selenium
>>> from selenium import webdriver

安装Chromedriver,打开http://npm.taobao.org/mirrors/chromedriver ，点击下载chromedriver_win32.zip
解压后，把 chromedriver.exe 放到D:\Python36\Scripts
使用selenium库打开chrome浏览器代码示例：
```
>>> from selenium import webdriver
>>> driver = webdriver.Chrome()
```
运行后，会打开一个谷歌浏览器，此外需要注意的是chrome版本需要大于等于55，因为驱动是这样的要求

Step4：phantomjs　　

　　PhantomJS 是一个基于WebKit的服务器端 JavaScript API。它全面支持web而不需浏览器支持，其快速，原生支持各种Web标准： DOM 处理, CSS 选择器, JSON, Canvas, 和 SVG。PhantomJS可以用于页面自动化，网络监测，网页截屏，以及无界面测试等。

简而言之：基于WebKit的，没有界面的浏览器。

　　闪亮的功能点：PhantomJS可以用于页面自动化，网络监测，网页截屏，以及无界面测试。

　　优势：跨平台，易上手。

安装步骤：

下载网址http://phantomjs.org/download.html
解压，获得phantomjs.exe 文件路径 D:\phantomjs-2.1.1-windows\bin，然后配置到用户变量中的path变量中
打开cmd，输入：phantomjs

ps:chrome headlessl可以替代phantomjs，为什么呢？因为selenium不再支持phantomjs了

Step5：chrome headless

　　测试代码（刚刚百度来的）：这个是chrome的示例

from selenium import webdriver
options=webdriver.ChromeOptions()
options.set_headless()
# options.add_argument('--headless')
options.add_argument('--disable-gpu')
driver=webdriver.Chrome(options=options)
driver.get('http://httpbin.org/user-agent')
driver.get_screenshot_as_file('test.png')
driver.close()

　　FireFox浏览器的示例：

from selenium import webdriver
options = webdriver.FirefoxOptions()
options.set_headless()
# options.add_argument('-headless')
options.add_argument('--disable-gpu')
driver=webdriver.Firefox(firefox_options=options)
driver.get('http://httpbin.org/user-agent')
driver.get_screenshot_as_file('test.png')
driver.close()

Step6：lxml

　　简介：lxml是python中处理xml的一个非常强大的库，可以非常方便的解析和生成xml文件。

安装命令：pip3 install lxml
PS:如果安装失败了，可以多试几次，或者使用whl安装

Step7：beautifulsoup

　　简介：Beautiful Soup 是一个可以从HTML或XML文件中提取数据的Python库。它能够通过你喜欢的转换器实现惯用的文档导航,查找,修改文档的方式.Beautiful Soup会帮你节省数小时甚至数天的工作时间。

　　安装步骤：

依赖lxml库，所以要先安装lxml
cmd: pip3 install beautifulsoup4

测试代码:

>>> from bs4 import BeautifulSoup
>>> soup = BeautifulSoup('<html></html>','lxml')
>>>

Step8：pyquery

　　简介：pyquery相当于jQuery的python实现，可以用于解析HTML网页等。它的语法与jQuery几乎完全相同。

　　安装步骤：

安装命令： pip3 install pyquery

测试代码

>>> from pyquery import PyQuery as pq
>>> doc = pq('<html>Python</html>')
>>> result = doc('html').text()
>>> result
'Python'

pyquery的基础使用方法可以参考：https://www.cnblogs.com/lei0213/p/7676254.html

Step9：pymysql

　　简介：PyMySQL 是在 Python3.x 版本中用于连接 MySQL 服务器的一个库

　　安装步骤：

命令：pip3 install pymysql

测试代码：

>>> import pymysql
>>> conn = pymysql.connect(host='localhost',user='root',password='123456',port=3306,db='mysql')
>>> cursor = conn.cursor()
>>> cursor.execute('select * from db')
2
>>> cursor.fetchone()
('localhost', 'performance_schema', 'mysql.session', 'Y', 'N', 'N', 'N', 'N', 'N', 'N', 'N', 'N', 'N', 'N', 'N', 'N', 'N', 'N', 'N', 'N', 'N', 'N')
>>> cursor.fetchall()
(('localhost', 'sys', 'mysql.sys', 'N', 'N', 'N', 'N', 'N', 'N', 'N', 'N', 'N', 'N', 'N', 'N', 'N', 'N', 'N', 'N', 'N', 'N', 'Y'),)

Step10：pymongo

　　简介：PyMongo是驱动程序，使python程序能够使用Mongodb数据库，使用python编写而成

　　安装步骤：

安装命令：pip3 install pymongo

测试代码：

>>> import pymongo
>>> client = pymongo.MongoClient('localhost')
>>> db = client['newtest']
>>> db['table'].insert({'name':'python'})
ObjectId('5abe67d64bc36b29c0a61a03')
>>> db['table'].find_one({'name':'python'})
{'_id': ObjectId('5abe67d64bc36b29c0a61a03'), 'name': 'python'}

Step11：redis

　　简介：Python分布式爬虫比較经常使用的应该是scrapy框架加上Redis内存数据库，中间的调度任务等用scrapy-redis模块实现。

　　安装步骤：

安装命令：pip3 install redis

测试代码：

#数据的插入和获取
>>> import redis
>>> r = redis.Redis('localhost',6379)
>>> r.set('name','python')
True
>>> r.get('name')

Step12：flask

　　简介：Flask是一个Python编写的Web 微框架，让我们可以使用Python语言快速实现一个网站或Web服务

　　安装步骤：

安装命令：pip3 install flask

测试代码：

from flask import Flask
app = Flask(__name__)

@app.route('/')
def hello_world():
    return 'Hello World!'

if __name__ == '__main__':
    app.run()

参考文档：官方文档：http://docs.jinkan.org/docs/flask/

Step13：django

　　简介：web服务器框架

　　安装步骤：

安装命令：pip3 install django
测试代码 import django

Step14：jupyter

　　安装步骤：

安装命令： pip3 install jupyter
运行->打开cmd，输入：jupyter notebook
然后浏览器会自动打开应用程序

学习总结：

　　生活过于安逸，是感觉不到行业的竞争压力，所以还是多学习，增强自己的测试的核心竞争能力吧。

标签：

版权申明：本站文章部分自网络，如有侵权，请联系：west999com@outlook.com
特别注意：本站所有转载文章言论不代表本站观点，本站所提供的摄影照片，插画，设计作品，如需使用，请与原作者联系，版权归原作者所有

上一篇：python中的内置函数max()和min()

下一篇：QuantLib 金融计算——基本组件之 Date 类

python3基础之“术语表（2）” 2019-08-13
python3 之字符串编码小结（Unicode、utf-8、gbk、gb2312等 2019-08-13
Python3安装impala 2019-08-13
小白如何入门 Python 爬虫？ 2019-08-13
python_字符串方法 2019-08-13

IDC资讯：主机资讯注册资讯托管资讯 vps资讯网站建设

网站运营：建站经验策划盈利搜索优化网站推广免费资源

网站联盟：联盟新闻联盟介绍联盟点评网赚技巧

行业资讯：搜索引擎网络游戏电子商务广告传媒

网络编程： Asp.Net编程 Asp编程 Php编程 Xml编程 Access Mssql Mysql 其它

服务器技术： Web服务器 Ftp服务器 Mail服务器 Dns服务器安全防护

软件技巧：其它软件 Word Excel Powerpoint Ghost Vista QQ空间 QQ FlashGet 迅雷

网页制作： FrontPages Dreamweaver Javascript css photoshop fireworks Flash

程序设计： Java技术 C/C++ VB delphi

网络知识：网络协议网络安全网络管理组网方案 Cisco技术

操作系统： Win2000 WinXP Win2003 Mac OS Linux FreeBSD

热门词条

最新资讯

热门关注

热门标签

Python爬虫学习==&gt;第五章：爬虫常用库的…

学习目的：

正式步骤

Step1：urllib和re库

Step2：requests库安装

Step3：selenium库的安装

Step4：phantomjs

Step5：chrome headless

Step6：lxml

Step7：beautifulsoup

Step8：pyquery

Step9：pymysql

Step10：pymongo

Step11：redis

Step12：flask

Step13：django

Step14：jupyter

学习总结：

Python爬虫学习==>第五章：爬虫常用库的…

Step4：phantomjs