我想要webcrapthis页面动态表单,我现在正在使用Selenium来实现这一点并获得一些结果。在
我的问题:
1)是否可以用一些POST请求替换Selenium+WebDriver代码?(我以前也处理过请求,但只有当API可用时。。。我不知道如何对该表单进行反向编码)
2)是否有更好的方法来清理结果页以仅获取表?(在我的示例中,result“data”变量很混乱,但无论如何,我已经获得了最后一个值,这是脚本的主要用途)
3)有什么建议吗?在
我的代码:
from selenium import webdriver
import pandas as pd
from bs4 import BeautifulSoup
def get_tables(htmldoc):
soup = BeautifulSoup(htmldoc)
return soup.findAll('table')
driver = webdriver.Chrome()
driver.get("http://dgasatel.mop.cl/visita_new.asp")
estacion1 = driver.find_element_by_name("estacion1")
estacion1.send_keys("08370007-6")
driver.find_element_by_xpath("//input[@name='chk_estacion1a' and @value='08370007-6_29']").click()
driver.find_element_by_xpath("//input[@name='period' and @value='1d']").click()
driver.find_element_by_xpath("//input[@name='tiporep' and @value='I']").click()
driver.find_element_by_name("button22").click()
data = pd.read_html(driver.page_source)
print(data[4].tail(1).iloc[0][2])
提前谢谢。在
对您的问题的简短回答是肯定的,您可以使用请求库来发出post请求。例如,您可以在浏览器上轻松打开检查器并使用以下站点复制请求:
https://curl.trillworks.com/
然后你可以喂响应.text进入BeautifulSoup以解析出所需的表。在
当我对您的示例中的站点执行此操作时,我得到以下结果:
为了清理数据,我建议您将所需的数据点映射到字典或带有循环的csv中。在
^{pr2}$相关问题 更多 >
编程相关推荐