Python爬虫_Web网络爬虫_搜索引擎蜘蛛Spider

Python爬虫_Web网络爬虫_搜索引擎蜘蛛Spider

2017-04-11 15:00:11

Python爬虫也是网络爬虫的一类，是能够自动或半自动抓取网页内容的Python脚本，爬虫也是搜索引擎的重要组成部分，因此SEO搜索引擎优化很大程度上就是针对爬虫抓取框架而做出的优化，也可以用Python做出很多SEO的实用工具。

python网页爬虫程序主要分类为搜索引擎从万维网下载网页。一般分为传统爬虫和聚焦爬虫。传统爬虫从一个或若干初始网页的URL开始，获得初始网页上的URL在抓取网页的过程中，不断从当前页面上抽取新的URL放入队列，直到满足系统的一定停止条件。

python3spider 框架通过对网页的源码解析来获得想要的内容，聚焦爬虫的工作流程较为复杂，需要根据一定的网页分析算法过滤与主题无关的链接，保留有用的链接并将其放入等待抓取的URL队列。

根据一定的搜索策略从队列中选择下一步要抓取的网页URL下载下来，并重复上述过程，直到达到系统的某一条件时停止。另外，所有被python 网络爬虫抓取的网页将会被系统存贮，进行一定的分析、过滤，并建立索引，以便之后的查询和检索；对于聚焦爬虫来说，这一过程所得到的分析结果还可能对以后的抓取过程给出反馈和指导，玩蛇网这个频道主要分享关于Python网络爬虫和抓取相关的知识。
原文地址：http://www.iplaypy.com/crawler/