赞
踩
本文希望达到以下目标:
我们正式讲scrapy框架爬虫,并用豆瓣来试试手,url:http://movie.douban.com/top250
首先先要回答一个问题。问:把网站装进爬虫里,总共分几步?
答案很简单,四步:
好的,基本流程既然确定了,那接下来就一步一步的完成就可以了。
1.新建项目(Project)
在空目录下按住Shift键右击,选择“在此处打开命令窗口”,输入一下命令:
<span style="font-size:14px;">scrapy startproject douban</span>
其中,douban为项目名称。
可以看到将会创建一个douban文件夹,目录结构如下:
douban/
scrapy.cfg
douban/
__init__.py
items.py
pipelines.py
settings.py
spiders/
__init__.py
...</span>
我们用pycharm打开该项目,具体看一下:
下面来简单介绍一下各个文件的作用:
Copyright © 2003-2013 www.wpsshop.cn 版权所有,并保留所有权利。