selenium和bs4的联合使用

Selenium可以模拟浏览器点击或登录网站的行为。但在获取网站文本上并不方便。可以尝试使用Selenium+bs4获取文本信息。

  1. 导入相关库
from selenium import webdriver
import time
from bs4 import BeautifulSoup
  1. 打开网页
url = "https://www.xxx.com"
driver.get(url)
driver = webdriver.Chrome()
  1. 模拟浏览器活动

点击

driver.find_element_by_id("tier1-select").click()

或者登陆

driver.find_element_by_css_selector(".login-list > input:nth-child(2)").send_keys(xxxx)
driver.find_element_by_css_selector(".login-btnStyle").click()

记得代码中加上

time.sleep(1)
  1. 获取当前页面文本信息
soup = BeautifulSoup(driver.page_source, html.parser)
list_a = soup.find_all(a)

您还可以使用CSS、XPATH或正则表达式来获取所需的文本

经验分享 程序员 微信小程序 职场和发展