用itemloader提取，清洗数据的技巧

时间 2019-11-13

标签 itemloader 提取清洗数据技巧繁體版

原文原文链接

    def parse_item(self, response):
        item_loader = NewItemLoader(NewItem(), response) item_loader.add_xpath('title', '//div[@id="chan_newsBlk"]/h1/text()') item_loader.add_xpath('time', '//div[@id="chan_newsInfo"]/text()', re='(\d+-\d+-\d+\s\d+:\d+:\d+)') item_loader.add_value('url', response.url) item_loader.add_xpath('text', '//div[@id="chan_newsDetail"]//text()') item_loader.add_xpath('source', '//div[@id="chan_newsInfo"]/text()', re='来源：(.*)')

在用到itemloader时，既能够经过在item中定义一些函数，做为input_processor()的参数对提取的数据进行修改，也能够直接在提取的字段后面加入本身的正则表达式提取数据。如上图中的re语句。正则表达式