用Excel分析豆瓣读书数据

1.提出问题

2.理解数据

3.数据清洗

3.1删除重复值

我们选择首先删除数据的重复值,这可以避免后续无意义的运算。 数据>数据工具>删除重复值>全选

3.2处理缺失值

3.2.1书名

这一列有两种缺失值,一是【None】,二是【点击上传封面图片】,失去书名的记录没有利用价值,我们筛选出这两种情况并将其删除。

3.2.3页数、评论数

页数、评分和评论数的缺失值占比都很小,我们选择用平均值填充。 页数的数据类型混乱,需要做额外处理。 我们可以看到页数这一个字段下的数据非常混论,有些单元格含有字母、符号以及其它语言,我们把这些非数字的单元格以页数的平均值填充。 怎么从内容混乱的单元格内提取出只含有数字的单元格呢? 筛选>条件格式>新建规则 选择”使用公式确定单元格格式”,我们使用公式”=ISNUMBER(-E2)”选出类型为数字的单元格,并以颜色填充。 以颜色筛选,算出所有数字单元格的平均值,以平均值填充None值。

3.3空格数据处理

我们使用TRIM()函数删除所有数据前后的空格。

3.4日期处理

对于出版日期中不规范的数据,如”2019.5.4”,用”/”替换掉”.”,选中”出版日期”,使用分列功能将出版日期整理成统一的日期格式。 数据>数据工具>分列>下一步>下一步>日期 对于出版日期,我们只需要年份就可以了,使用”LEFT()”函数,截取字符串前4位,结果发现有些数据是正常的,有些则是计算由1900年到单元格数据的时间间隔,两者数据不统一,那我们将出版日期用分列功能将其设置为文本,然后使用”LEFT()”函数截取年份。

4.数据分析及可视化

4.1最受欢迎的书籍(评分>9,评论数>5w)

隐藏其它字段,保留书名、评分和评论数: 可以看到,在这九本最受欢迎的书中,国内外经典文学占有四部,大家还是很喜欢经典文学的,科幻占两部,都是刘慈欣的《三体》。

4.3近十年出版最多的出版社

从表中筛选出版时间为2009-2019年的记录,插入数据透视表,选择出版社为行标签,ISBN为计数项,降序排列: 筛选出版批次前10的出版社并做成条形图: 可以看出中信出版社近十年出版书籍批次最多,远多于第二名人民邮电出版社和第三名机械工业出版社,第四名以后的出版社差距不是很大。

4.3评分和评论数量关系

5.总结

经验分享 程序员 微信小程序 职场和发展