scrapy爬虫时如何利用xpath爬取某个div里所有p的内容

当我们想爬取div class="articlebody"下p中所有文本的时候,如果这样写

item['body'] = (response.xpath('//div[@class="articleBody"]/ptext()').extract()[0])

会发现仅仅是第一个p中的内容,而不是所有的,此时应该利用的是for循环。

divs=response.xpath('//div[@class="articleBody"]')

body=""

for p in divs.xpath('.//p/text()'):

body=body+ p.extract().strip()

item['body']=body

最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

推荐阅读更多精彩内容