使用Scrapy搜寻隐藏数据

Question

我刚开始爬行。 我正在尝试通过使用Scrapy框架和Python 2.7下载内容来从网站http://www.indiabix.com/verbal-ability/spotting-errors/抓取问题和答案。 我注意到，如果您查看其来源，则会注意到每个问题的答案都应该在b标记中，但不能在：

<div class="div-spacer">
   <p><span class="ib-green"><b>Answer:</b></span> Option <b class="jq-hdnakqb"></b></p> 
   <p><span class="ib-green"><b>Explanation:</b></span></p> 
   <p> No answer description available for this question. <b><a href="discussion-399">Let us discuss</a></b>. </p>

如果我们检查网页上的元素，我们可以在标签之间以文本形式看到正确的答案：答案：每个问题的选项A或B等，但HTML源代码没有。

为了在b标签中获取文本，我尝试使用xpath进行了15次查询。 我在下面的代码中以注释的形式编写了最可能的4-5个查询。

import scrapy
import urllib
import json
from errors1.items import Errors1Item

class Errors1Spider(scrapy.Spider) :
    name = "errors1"
    start_urls =  ["http://www.indiabix.com/verbal-ability/spotting-errors/"]

    def parse(self, response) :
        i = 0
        y = 0
        j = json.loads(json.dumps(response.xpath('//td[contains(@id, "tdOption")]/text()').extract()))
        x = json.loads(json.dumps(response.xpath('//div[@class="div-spacer"]/p[3]/text()').extract()))

        #to get correct answer
        #response.xpath('//div[@class = "div-spacer"]/p/b/text()').extract()
        #response.xpath('//div[@class = "div-spacer"]/p[1]/b/text()').extract()
        #response.xpath('//div[@class = "div-spacer"]/p//text()').extract()
        #response.xpath('//b[@class = "jq-hdnakqb"]/text()').extract()
        #response.xpath('string(//div[@class = "div-spacer"]/p/b/text())').extract()

        while i<len(j) and y<len(x) :
            item = Errors1Item()
            item['optionA'] = j[i]
            i+=1 
            item['optionB'] = j[i]
            i+=1 
            item['optionC'] = j[i]
            i+=1 
            item['optionD'] = j[i]
            i+=1 
            item['explanation'] = x[y]
            y+=1
            yield item

有人可以帮我从该网页获得答案的内容。 谢谢

Answer 1

据我了解，设置正确的选项值涉及到JavaScript逻辑。

帮助我解决它的是scrapyjs中间件，它使用了Splash浏览器即服务。 跳过安装和配置，这是我执行的蜘蛛程序：

# -*- coding: utf-8 -*-
import scrapy


class IndiaBixSpider(scrapy.Spider):
    name = "indiabix"
    allowed_domain = ["www.indiabix.com"]
    start_urls = ["http://www.indiabix.com/verbal-ability/spotting-errors/"]

    def start_requests(self):
        for url in self.start_urls:
            yield scrapy.Request(url, meta={
                'splash': {
                    'endpoint': 'render.html',
                    'args': {'wait': 0.5}
                }
            })

    def parse(self, response):
        for question in response.css("div.bix-div-container"):
            answer = question.xpath(".//input[starts-with(@id, 'hdnAnswer')]/@value").extract()
            print answer

这是我在控制台上得到的（正确答案）：

[u'A']
[u'C']
[u'A']
[u'C']
[u'C']
[u'C']
[u'B']
[u'A']
[u'D']
[u'C']
[u'B']
[u'B']
[u'A']
[u'B']
[u'B']

也可以看看：

https://stackoverflow.com/a/30378765/771848

使用Scrapy搜寻隐藏数据

问题描述

1 个解决方案

解决方案1
1 2015-07-03 13:47:41

使用Scrapy搜寻隐藏数据

问题描述

1 个解决方案

解决方案1 1 2015-07-03 13:47:41

解决方案1
1 2015-07-03 13:47:41