ADSL拨号VPS包含了中国大陆（联通，移动，电信，）

中国香港，国外拨号VPS。

当前位置：云主机 > python >

电信ADSL拨号VPS

上饶电信拨号VPS

洛阳电信拨号VPS

威海电信拨号VPS

济南电信拨号VPS

九江电信拨号VPS

厦门电信拨号VPS

邢台电信拨号VPS

湖州电信拨号VPS

绍兴电信拨号VPS

宁波电信拨号VPS

温州电信拨号VPS

杭州电信拨号VPS

郑州电信拨号VPS

铜陵电信拨号VPS

池州电信拨号VPS

黄山电信拨号VPS

十堰电信拨号VPS

荆门电信拨号VPS

莆田电信拨号VPS

三明电信拨号VPS

永州电信拨号VPS

张家界电信拨号VPS

常德电信拨号VPS

昆明电信拨号VPS

丽江电信拨号VPS

马鞍山电信拨号VPS

宣城电信拨号VPS

合肥电信拨号VPS

淮北电信拨号VPS

泰州电信拨号VPS

南通电信拨号VPS

南京电信拨号VPS

扬州电信拨号VPS

宿迁电信拨号VPS

镇江电信拨号VPS

苏州电信拨号VPS

淮安电信拨号VPS

盐城电信拨号VPS

包头电信拨号VPS

海口电信拨号VPS

江门电信拨号VPS

眉山电信拨号VPS

德阳电信拨号VPS

衢州电信拨号VPS

上海电信拨号VPS

桂林电信拨号VPS

成都电信拨号VPS

鞍山电信拨号VPS

福州电信拨号VPS

柳州电信拨号VPS

无锡电信拨号VPS

乌兰察布电信拨号VPS

深圳电信拨号VPS

河源电信拨号VPS

秦皇岛电信拨号VPS

徐州电信拨号VPS

台州电信拨号VPS

芜湖电信拨号VPS

蚌埠电信拨号VPS

潮州电信拨号VPS

重庆电信拨号VPS

连云港电信拨号VPS

绵阳电信拨号VPS

泰安电信拨号VPS

晋城电信拨号VPS

广州电信拨号VPS

联通ADSL拨号VPS

北京联通拨号VPS

滨州联通拨号VPS

莱芜联通拨号VPS

鞍山联通拨号VPS

连云港联通拨号VPS

海口联通拨号VPS

徐州联通拨号VPS

重庆联通拨号VPS

上海联通拨号VPS

西昌联通拨号VPS

南充联通拨号VPS

枣庄联通拨号VPS

抚顺联通拨号VPS

唐山联通拨号VPS

保定联通拨号VPS

廊坊联通拨号VPS

武汉联通拨号VPS

泰安联通拨号VPS

雅安联通拨号VPS

盘锦联通拨号VPS

泰州联通拨号VPS

移动ADSL拨号VPS

盐城移动拨号VPS

莱芜移动拨号VPS

python爬虫常用的模块分析

时间:2021-11-09 10:23 作者:admin610456

本文对python/' target='_blank'>python爬虫常用的模块做了较为深入的分析，并以实例加以深入说明。分享给大家供大家参考之用。具体分析如下：

creepy模块

某台湾大神开发的，功能简单，能够自动抓取某个网站的所有内容，当然你也可以设定哪些url需要抓。

地址：https://pypi.Python.org/pypi/creepy

功能接口：

set_content_type_filter:
设定抓取的content-type（header中的contenttype）。包括text/html

add_url_filter：
过滤url，传入的可以是正则表达式

set_follow_mode：
设定递归模式，F_ANY：该页面上所有链接都会抓取。 F_SAME_DOMAIN和F_SAME_HOST类似。即同一个域名的都会抓取。F_SAME_PATH：同一路径的抓取。例如bag.vancl.com/l1/d3/1.jpg path为l1/d3/1.jpg，则path为l1/d3/*的都会抓取。这里可以根据需要增加自己的递归模式

set_concurrency_level：
设定线程最大数

process_document：
一般需要重写，处理网页内容，提取自己需要的内容。

selenium
可视化界面，抓取自动化，api使用超简单，完全像是自己在操作浏览器。

官方网站：http://www.seleniumhq.org/
python官方网站
http://pypi.python.org/pypi/selenium
webdriver api（很好用，建议多了解一下）
http://www.seleniumhq.org/docs/03_webdriver.jsp

以下是一个抓取凡客网站的例子：

from selenium import webdriverfrom selenium.webdriver.common.keys import Keysimport timebrowser = webdriver.Firefox()browser.get('http://bag.vancl.com/28145-28167-a18568_18571-b1-n3-s1.html#ref=hp-hp-hot-8_1_1-v:n')elem = browser.find_element_by_name('ch_bag-3-page-next') # Find the search boxtime.sleep(1)print elem.get_attribute("href")elem.click()time.sleep(1)elem = browser.find_element_by_name('ch_bag-3-page-next') # Find the search boxprint elem.get_attribute("href")elem.click()

希望本文所述对大家的Python程序设计有所帮助。

(责任编辑：admin)

上一篇：闭包在python中的应用之translate和maketrans用法详解
下一篇：Python3.0与2.X版本的区别实例分析

帮助中心: 会员注册; 找回密码; 新闻中心

快捷通道: 域名登录面板; 虚机登录面板; 云主机登录面板

关于我们: 关于我们; 联系我们

联系方式: 售前咨询：17830004266(重庆移动); 企业QQ：383546523

《中华人民共和国工业和信息化部》编号：ICP备00012341号

Copyright © 2002 -2018 香港云主机版权所有
声明：香港云主机品牌标志、品牌吉祥物均已注册商标，版权所有，窃用必究

云官方微信

在线客服

企业QQ:
技术支持：383546523

公司总台电话：17830004266(重庆移动)
售前咨询热线：17830004266(重庆移动)