Just Do IT !

使用etree与xpath爬取Discuz论坛

字数统计: 88阅读时长: 1 min
2019/11/28 Share

引入模块

在pycharm中下载lxml库
通过from lxml import etree引入模块

测试

1
2
3
4
5
6
7
8
import requests
from lxml import etree
url = "https://www.discuz.net/forum-developer-1.html"
text = requests.get(url).text
html = etree.HTML(text)
context = etree.tostring(html).decode()
print(html.xpath('//div[@id="threadlist"]/div[2]/form/table/*'))
print(html.xpath('//*[@id="threadlisttableid"]/*'))

在这里插入图片描述
在这里插入图片描述
这里是通过xpath语法将论坛的所有tbody便签

1
print(html.xpath('//tbody/tr/th/a[@class="s xst"]/text()'))

在这里插入图片描述

CATALOG
  1. 1. 引入模块
  2. 2. 测试