scrapy学习总结-白红宇

强烈建议你试试无所不能的chatGPT，快点击我

scrapy学习总结

阅读量：6315 次

发布时间：2019-06-22

本文共 587 字，大约阅读时间需要 1 分钟。

1.为了配合XPath，Scrapy除了提供了之外，还提供了方法来避免每次从response中提取数据时生成selector的麻烦

Selector有四个基本的方法(点击相应的方法可以看到详细的API文档):

: 传入xpath表达式，返回该表达式所对应的所有节点的selector list列表。

: 传入CSS表达式，返回该表达式所对应的所有节点的selector list列表.

: 序列化该节点为unicode字符串并返回list。

: 根据传入的正则表达式对数据进行提取，返回unicode字符串list列表。

2.为了创建一个Spider，您必须继承类，且定义以下三个属性:

: 用于区别Spider。该名字必须是唯一的，您不可以为不同的Spider设定相同的名字。

: 包含了Spider在启动时进行爬取的url列表。因此，第一个被获取到的页面将是其中之一。后续的URL则从初始的URL获取到的数据中提取。

是spider的一个方法。被调用时，每个初始URL完成下载后生成的对象将会作为唯一的参数传递给该函数。该方法负责解析返回的数据(response data)，提取数据(生成item)以及生成需要进一步处理的URL的对象

转载于:https://www.cnblogs.com/xiaohaillong/p/5908394.html

你可能感兴趣的文章

C++内存布局之虚拟继承

Sqlserver 数据库基本查询

图书馆维护系统总结

[hadoop源码阅读][5]-counter的使用和默认counter的含义

NOOK2刷机成功

NSIndexPath的初始化方法

Lucene的索引不跨平台

【转】快捷支付详解--比较详细

golang 创建一个简单的资源池，重用资源，减少GC负担

30分钟学会如何使用Shiro(转)

JSP编译成Servlet（五）JDT Compiler编译器

基于微软企业库的AOP组件(含源码)

C#进阶系列——WebApi 路由机制剖析：你准备好了吗？

Java基础加强之集合

SpringBoot和SpringCloud面试题

Consul vs. Zookeeper

一个集算法，技术挺有深广度的老外blog,值得看

（译）碰撞检测和收集物品：如何使用cocos2d制作基于tiled地图的游戏：第二部分...

ASP.NET开发，且编且改，分清职责

CSS定位规则之BFC 你居然一直不知道的东西！！！！！

喝酒易醉，品茶养心，人生如梦，品茶悟道，何以解忧？唯有杜康！-- 愿君每日到此一游！

当前时间: 2025-01-10 20:04:21 当前IP: 18.119.164.231 联系邮箱:javaeecc@qq.com Copyright © 2020 - 2022 baihongyu.com 京ICP备2021015314号-2

强烈建议你试试无所不能的CHAT-GPT，快点击我

强烈建议你试试无所不能的CHAT-GPT，快点击我