selenium和bs4的联合使用
Selenium可以模拟浏览器点击或登录网站的行为。但在获取网站文本上并不方便。可以尝试使用Selenium+bs4获取文本信息。
- 导入相关库
from selenium import webdriver import time from bs4 import BeautifulSoup
- 打开网页
url = "https://www.xxx.com" driver.get(url) driver = webdriver.Chrome()
- 模拟浏览器活动
点击
driver.find_element_by_id("tier1-select").click()
或者登陆
driver.find_element_by_css_selector(".login-list > input:nth-child(2)").send_keys(xxxx)
driver.find_element_by_css_selector(".login-btnStyle").click()
记得代码中加上
time.sleep(1)
- 获取当前页面文本信息
soup = BeautifulSoup(driver.page_source, html.parser) list_a = soup.find_all(a)
您还可以使用CSS、XPATH或正则表达式来获取所需的文本
