1.为了配合XPath,Scrapy除了提供了 之外,还提供了方法来避免每次从response中提取数据时生成selector的麻烦
Selector有四个基本的方法(点击相应的方法可以看到详细的API文档):
- : 传入xpath表达式,返回该表达式所对应的所有节点的selector list列表 。
- : 传入CSS表达式,返回该表达式所对应的所有节点的selector list列表.
- : 序列化该节点为unicode字符串并返回list。
- : 根据传入的正则表达式对数据进行提取,返回unicode字符串list列表。
2.为了创建一个Spider,您必须继承 类, 且定义以下三个属性:
- : 用于区别Spider。 该名字必须是唯一的,您不可以为不同的Spider设定相同的名字。
- : 包含了Spider在启动时进行爬取的url列表。 因此,第一个被获取到的页面将是其中之一。 后续的URL则从初始的URL获取到的数据中提取。
- 是spider的一个方法。 被调用时,每个初始URL完成下载后生成的 对象将会作为唯一的参数传递给该函数。 该方法负责解析返回的数据(response data),提取数据(生成item)以及生成需要进一步处理的URL的 对象