Scrapy - 动态等待页面加载 - selenium + scrapy

我最近用python和Selenium做了一个webscraper，我发现它很简单。该页面使用ajax调用来加载数据，并初始化我等待一个固定的time_out来加载页面。这工作了一段时间。之后，我发现硒具有内置函数，WebDriverWait可以使用wait.until（）等待加载特定元素。这使我的webscraper运行得更快。Scrapy - 动态等待页面加载 - selenium + scrapy

问题是，我仍然不满意的结果。我花费了平均每页1.35秒来下载内容。

我试图平行这一点，但时间并没有因为创建如果驱动程序实例（与Chrome或PhantomJS）花费了大部分刮擦时间。

所以我把自己转向了scrapy。做完教程后，我的解析器已经写好了，我的两个问题是：

1）scrapy是否会自动运行多个url请求？

2）如何设置一个动态超时与scrapy，如硒

3）的WebDriverWait wait.until（）如果不存在动态出发时间可用于scrapy，并将该溶液是使用scrapy + selenium，让硒等待内容被加载，使用scrapy真的有什么优势吗？我可以simlply检索数据使用硒选择器，就像我之前使用scrapy

谢谢你的帮助。

来源

2017-09-18 Rafael Marques

是，Scrapy可以处理多个请求同时，其被安排和处理异步。这意味着Scrapy不需要等待请求被完成和处理，它可以发送另一个请求或在此期间做其他事情。简而言之，它的速度非常快，可以根据您的需要进行配置。

Splash是javascript rendering service。它是一个轻量级的带有HTTP API的Web浏览器，使用Twisted和QT5在Python 3中实现。在Scrapy中使用它可以像使用Selenium一样使用动态内容。通过默认飞溅等待为所有远程资源加载，但在大多数情况下，最好不要永远等待它们。要在超时后中止资源加载并为整个页面提供使用资源超时的机会，可以设置splash.resource_timeout或request:set_timeout。

同样，大的差异感觉来在速度不同的实现刮削过程的。由于Scrapy处理Asynchronously的事情，这比其他人有很大的优势。

来源

2017-09-18 15:24:02

Scrapy - 动态等待页面加载 - selenium + scrapy

回答

相关问题