当前位置: 首页 > news >正文

网站建设平台方案海宁营销型网站设计

网站建设平台方案,海宁营销型网站设计,订阅号可以建设微网站,国外域名注册网站 中文同事让帮忙在某个网站爬点数据,首次尝试爬虫,遇到的问题及解决思路记录下。 大体需求是需要爬取详情页内的信息,详情页有一定格式规律,但是详情页需要从列表页跳入,列表页中的每一条记录需要鼠标悬停才会弹出跳转链接…

同事让帮忙在某个网站爬点数据,首次尝试爬虫,遇到的问题及解决思路记录下。

大体需求是需要爬取详情页内的信息,详情页有一定格式规律,但是详情页需要从列表页跳入,列表页中的每一条记录需要鼠标悬停才会弹出跳转链接,点击后才可跳转,然后将数据存在excel中,一个个解决吧。

第一步是先爬取详情页的数据,发现页面数据是js渲染出来的,直接用请求获取不到信息,于是使用selenium来模拟浏览器实际请求,然后需要的各个标签值也都没有id,就根据class来获取值的列表,具体方法为

from selenium import webdriverstrurl = 'https://xxxxxxxx?id='+stribrowser = webdriver.Chrome()try:browser.get(strurl)item1 = browser.find_elements(by=By.CLASS_NAME, value="xxxxxxxx")item2 = browser.find_elements(by=By.CLASS_NAME, value="yyyyyyyy")item3 = browser.find_elements(by=By.CLASS_NAME, value="zzzzzzzz")# text='\n'+'基本信息:'+'\n'# for str1,str2 in zip(item1,item2):#   print(str1.text ,":",str2.text)#   text+=str1.text + ":"+ str2.text+'\n' #加入到字符串中,并换行## for str in item3:#   text+='\n'+"使用案例:" + str.text+'\n' #加入到字符串中,并换行#   print(str.text+ '\n')finally:browser.close()

获取到需要的值,然后需要把值放到excel中,使用openpyxl 将获取到的值拼成一行追加到excel中,具体方法如下:

from openpyxl import load_workbook# 打开 Excel 文件wb = load_workbook('test.xlsx')# 选择要操作的工作表ws = wb['Sheet2']new_data = []for str2 in item2:new_data.append(str2.text)for str in item3:new_data.append(str.text)# 在最后一行添加数据ws.append(new_data)# 保存文件wb.save('test.xlsx')

这样单详情页的内容可以搞到excel中了,需要搞抓所有记录的问题,因为列表页首先也是js渲染出来的,还有需要模拟悬停才能弹出跳转链接,研究了下详情页的url,都是xxx?id=aaa,这个aaa虽然是int,但是也没规律,随便找了几个值找不到对应页面的时候会报错,但是列表请求页可以看到对于列表的分页请求,相应为json格式,有个列表包含各个对象的id值,整好就是详情页的id值,那就这么搞把,列表信息通过这个请求模拟,然后从相应里取各个id,遍历跳转,一开始尝试了将列表请求跟遍历详情页拼在一个方法里,但是报“TypeError: 'WebElement' object is not callable”这个错,反正是自己用的小工具,先解决需求就行,分俩方法,把id结果集自己拼过来当参数,整合后参考代码如下,凑合看吧


{"code": 200,"message": "操作成功","data": {"pageNum": 2,"pageSize": 10,"totalPage": 10,"total": 100,"list": [{"id": aaaa,"logo": "6426cb.png"},{"id": bbbb,"logo": "6426cb.png"}]},"requestId": "abc"
}
import jsonwith open('searchResultP3.json', encoding='utf-8') as f:jsondata = json.load(f)jsonlist = jsondata["data"]["list"]datalist=[]for objjson in jsonlist:strid = str(objjson["id"])datalist.append(strid)print(datalist)
from selenium import webdriver
from selenium.webdriver.common.by import By
from openpyxl import load_workbookimport jsonfor stri in ['aaa', 'bbb', 'ccc']:strurl = 'https://xxx?id='+stribrowser = webdriver.Chrome()try:browser.get(strurl)item1 = browser.find_elements(by=By.CLASS_NAME, value="xxxxx")item2 = browser.find_elements(by=By.CLASS_NAME, value="yyyyy")item3 = browser.find_elements(by=By.CLASS_NAME, value="zzzzz")# text='\n'+'基本信息:'+'\n'# for str1,str2 in zip(item1,item2):#   print(str1.text ,":",str2.text)#   text+=str1.text + ":"+ str2.text+'\n' #加入到字符串中,并换行## for str in item3:#   text+='\n'+"使用案例:" + str.text+'\n' #加入到字符串中,并换行#   print(str.text+ '\n')# 打开 Excel 文件wb = load_workbook('test.xlsx')# 选择要操作的工作表ws = wb['Sheet2']new_data = []for str2 in item2:new_data.append(str2.text)for str in item3:new_data.append(str.text)# 在最后一行添加数据ws.append(new_data)# 保存文件wb.save('test.xlsx')finally:browser.close()
http://www.yayakq.cn/news/911634/

相关文章:

  • wordpress 下载站dj网站开发建设
  • 温县住房和城乡建设局网站APP和网站是一样吗
  • 泸县手机网站建设vatage wordpress主题
  • 网上做一道题2元的网站网站制作完成
  • 网站栏目结构1g内存做网站
  • 可信网站认证费用银川网站设计联系电话
  • 网站二级域名设置合肥做网站怎么样
  • 做海报的素材网站网站dns查询
  • 北京电商网站建设外包开网店软件
  • 免费申请域名建立网站有哪些网站可以做推文
  • 高档网站设计公司东莞常平邮编是多少
  • 东莞市建设局网站6建设银行广州支行网站
  • 建立网站 数据分析网站免费源代码
  • 做网站先做前台还是后台如何选择wordpress主机
  • 在百度里面做个网站怎么做百度竞价系统
  • 导航网站制作 zhihu园区官方网站建设
  • 天津个人网站制作为何网站打开慢
  • 用word做网站相关论文网站快速备案安全
  • 专做hip hop音乐的网站软件商店下载安装2023版本最新
  • 做网站找外包好吗做那种的视频网站有哪些
  • 网站建设优化服务特色英文网站设计
  • 给女友惊喜做网站iis 无法启动此网站
  • 建设网站能盈利吗少儿编程加盟费多少钱
  • 苏州市建设交易中心网站首页天元建设集团有限公司项目
  • 酒店网站设计的目的和意义上海公司购房政策
  • 如何做免费网站制作山东网站建设报价
  • 织梦装修网站模板做网站需要哪些人员
  • 网站外包哪家公司好深圳建设集团股份有限公司
  • 茂名专业做网站上海网站建设多少费用
  • 手机软件下载网站广州白云区