博客
关于我
强烈建议你试试无所不能的chatGPT,快点击我
scrapy学习总结
阅读量:6315 次
发布时间:2019-06-22

本文共 587 字,大约阅读时间需要 1 分钟。

1.为了配合XPath,Scrapy除了提供了  之外,还提供了方法来避免每次从response中提取数据时生成selector的麻烦

Selector有四个基本的方法(点击相应的方法可以看到详细的API文档):

  • : 传入xpath表达式,返回该表达式所对应的所有节点的selector list列表 。
  • : 传入CSS表达式,返回该表达式所对应的所有节点的selector list列表.
  • : 序列化该节点为unicode字符串并返回list。
  • : 根据传入的正则表达式对数据进行提取,返回unicode字符串list列表。

2.为了创建一个Spider,您必须继承  类, 且定义以下三个属性:

  • : 用于区别Spider。 该名字必须是唯一的,您不可以为不同的Spider设定相同的名字。
  • : 包含了Spider在启动时进行爬取的url列表。 因此,第一个被获取到的页面将是其中之一。 后续的URL则从初始的URL获取到的数据中提取。
  •  是spider的一个方法。 被调用时,每个初始URL完成下载后生成的  对象将会作为唯一的参数传递给该函数。 该方法负责解析返回的数据(response data),提取数据(生成item)以及生成需要进一步处理的URL的  对象

转载于:https://www.cnblogs.com/xiaohaillong/p/5908394.html

你可能感兴趣的文章
C++内存布局之虚拟继承
查看>>
Sqlserver 数据库基本查询
查看>>
图书馆维护系统总结
查看>>
[hadoop源码阅读][5]-counter的使用和默认counter的含义
查看>>
NOOK2刷机成功
查看>>
NSIndexPath的初始化方法
查看>>
Lucene的索引不跨平台
查看>>
【转】快捷支付详解--比较详细
查看>>
golang 创建一个简单的资源池,重用资源,减少GC负担
查看>>
30分钟学会如何使用Shiro(转)
查看>>
JSP编译成Servlet(五)JDT Compiler编译器
查看>>
基于微软企业库的AOP组件(含源码)
查看>>
C#进阶系列——WebApi 路由机制剖析:你准备好了吗?
查看>>
Java基础加强之集合
查看>>
SpringBoot和SpringCloud面试题
查看>>
Consul vs. Zookeeper
查看>>
一个集算法,技术挺有深广度的老外blog,值得看
查看>>
(译)碰撞检测和收集物品:如何使用cocos2d制作基于tiled地图的游戏:第二部分...
查看>>
ASP.NET开发,且编且改,分清职责
查看>>
CSS定位规则之BFC 你居然一直不知道的东西!!!!!
查看>>