本文实例讲述了Python基于pandas实现json格式转换成dataframe的方法。分享给大家供大家参考,具体如下:
# -*- coding:utf-8 -*- #!python3 import re import json from bs4 import BeautifulSoup import pandas as pd import requests import os from pandas.io.json import json_normalize class image_structs(): def __init__(self): self.picture_url = { "image_id": '', "picture_url": '' } class data_structs(): def __init__(self): # columns=['title', 'item_url', 'id','picture_url','std_desc','description','information','fitment']) self.info={ "title":'', "item_url":'', "id":0, "picture_url":[], "std_desc":'', "description":'', "information":'', "fitment":'' } # "https://waldoch.com/store/catalogsearch/result/index/" # https://waldoch.com/store/new-oem-ford-f-150-f150-5-running-boards-nerf-bar-crew-cab-2015-w-brackets-fl34-16451-ge5fm6.html def get_item_list(outfile): result = [] for i in range(6): print(i) i = str(i+1) url = "https://waldoch.com/store/catalogsearch/result/index/"+i+"&q=nerf+bar" web = requests.get(url) soup = BeautifulSoup(web.text,"html.parser") alink = soup.find_all("a",class_="product-image") for a in alink: title = a["title"] item_url = a["href"] result.append([title,item_url]) df = pd.DataFrame(result,columns=["title","item_url"]) df = df.drop_duplicates() df["id"] =df.index df.to_excel(outfile,index=False) def get_item_info(file,outfile): DEFAULT_FALSE = "" df = pd.read_excel(file) for i in df.index: id = df.loc[i,"id"] if os.path.exists(str(int(id))+".xlsx"): continue item_url = df.loc[i,"item_url"] url = item_url web = requests.get(url) soup = BeautifulSoup(web.text, "html.parser") # 图片 imglink = soup.find_all("img", class_=re.compile("^gallery-image")) data = data_structs() data.info["title"] = df.loc[i,"title"] data.info["id"] = id data.info["item_url"] = item_url for a in imglink: image = image_structs() image.picture_url["image_id"] = a["id"] image.picture_url["picture_url"]=a["src"] print(image.picture_url) data.info["picture_url"].append(image.picture_url) print(data.info) # std_desc std_desc = soup.find("div", itemprop="description") try: strings_desc = [] for ii in std_desc.stripped_strings: strings_desc.append(ii) strings_desc = "\n".join(strings_desc) except: strings_desc=DEFAULT_FALSE # description try: desc = soup.find('h2', text="Description") desc = desc.find_next() except: desc=DEFAULT_FALSE description=desc # information try: information = soup.find("h2", text='Information') desc = information desc = desc.find_next() except: desc=DEFAULT_FALSE information = desc # fitment try: fitment = soup.find('h2', text='Fitment') desc = fitment desc = desc.find_next() except: desc=DEFAULT_FALSE fitment=desc data.info["std_desc"] = strings_desc data.info["description"] = str(description) data.info["information"] = str(information) data.info["fitment"] = str(fitment) print(data.info.keys()) singledf = json_normalize(data.info,"picture_url",['title', 'item_url', 'id', 'std_desc', 'description', 'information', 'fitment']) singledf.to_excel("test.xlsx",index=False) exit() # print(df.ix[i]) df.to_excel(outfile,index=False) # get_item_list("item_urls.xlsx") get_item_info("item_urls.xlsx","item_urls_info.xlsx")
这里涉及到的几个Python模块都可以使用pip install命令进行安装,如:
pip install BeautifulSoup4
pip install xlrd
pip install openpyxl
PS:这里再为大家推荐几款比较实用的json在线工具供大家参考使用:
在线JSON代码检验、检验、美化、格式化工具:
http://tools.jb51.net/code/json
JSON在线格式化工具:
http://tools.jb51.net/code/jsonformat
在线XML/JSON互相转换工具:
http://tools.jb51.net/code/xmljson
json代码在线格式化/美化/压缩/编辑/转换工具:
http://tools.jb51.net/code/jsoncodeformat
在线json压缩/转义工具:
http://tools.jb51.net/code/json_yasuo_trans
更多Python相关内容感兴趣的读者可查看本站专题:《Python操作json技巧总结》、《Python编码操作技巧总结》、《Python数据结构与算法教程》、《Python函数使用技巧总结》、《Python字符串操作技巧汇总》、《Python入门与进阶经典教程》及《Python文件与目录操作技巧汇总》
希望本文所述对大家Python程序设计有所帮助。
免责声明:本站资源来自互联网收集,仅供用于学习和交流,请遵循相关法律法规,本站一切资源不代表本站立场,如有侵权、后门、不妥请联系本站删除!
稳了!魔兽国服回归的3条重磅消息!官宣时间再确认!
昨天有一位朋友在大神群里分享,自己亚服账号被封号之后居然弹出了国服的封号信息对话框。
这里面让他访问的是一个国服的战网网址,com.cn和后面的zh都非常明白地表明这就是国服战网。
而他在复制这个网址并且进行登录之后,确实是网易的网址,也就是我们熟悉的停服之后国服发布的暴雪游戏产品运营到期开放退款的说明。这是一件比较奇怪的事情,因为以前都没有出现这样的情况,现在突然提示跳转到国服战网的网址,是不是说明了简体中文客户端已经开始进行更新了呢?
更新日志
- 凤飞飞《我们的主题曲》飞跃制作[正版原抓WAV+CUE]
- 刘嘉亮《亮情歌2》[WAV+CUE][1G]
- 红馆40·谭咏麟《歌者恋歌浓情30年演唱会》3CD[低速原抓WAV+CUE][1.8G]
- 刘纬武《睡眠宝宝竖琴童谣 吉卜力工作室 白噪音安抚》[320K/MP3][193.25MB]
- 【轻音乐】曼托凡尼乐团《精选辑》2CD.1998[FLAC+CUE整轨]
- 邝美云《心中有爱》1989年香港DMIJP版1MTO东芝首版[WAV+CUE]
- 群星《情叹-发烧女声DSD》天籁女声发烧碟[WAV+CUE]
- 刘纬武《睡眠宝宝竖琴童谣 吉卜力工作室 白噪音安抚》[FLAC/分轨][748.03MB]
- 理想混蛋《Origin Sessions》[320K/MP3][37.47MB]
- 公馆青少年《我其实一点都不酷》[320K/MP3][78.78MB]
- 群星《情叹-发烧男声DSD》最值得珍藏的完美男声[WAV+CUE]
- 群星《国韵飘香·贵妃醉酒HQCD黑胶王》2CD[WAV]
- 卫兰《DAUGHTER》【低速原抓WAV+CUE】
- 公馆青少年《我其实一点都不酷》[FLAC/分轨][398.22MB]
- ZWEI《迟暮的花 (Explicit)》[320K/MP3][57.16MB]