豆瓣评论【数据集分享】

相信很多做自然语言处理、数据分析的小伙伴们都接触过豆瓣评论数据集。

最近 《脱口秀大会5》 比较火,所以我就抓去了一份《脱5》的豆瓣短评数据集,样例如下表所示:

    其中,comment_score表示豆瓣评分,总共五颗星,对应总分为 10分。每一颗星对应2分。 不同星数对应的中文描述为:
{
  力荐: 5, 
  推荐: 4, 
  还行: 3, 
  较差: 2, 
  很差: 1
}
    comment_vote 代表的是有多少人赞同这条短评。

其实,豆瓣网站有严格的数据获取限制,用户仅仅能访问最热门的短评数据集共计 600 条。然后再进行翻页,网站系统则会禁止。

同时豆瓣也仅提供 200 条最新的短评。根据这些数据,我做了一个加权统计,《脱5》的豆瓣加权平均分仅仅有3.3分。口碑大大滑坡。

步骤如下:

如何在程序中加载

如果有编程经验,可以用python进行操作

    1 安装 jionlp 工具包
$ pip install jionlp
    2 编写以下代码执行
import jionlp as jio
comment_list = jio.read_file_by_line(/path/to/short_comment_has_watched_highest_tuokouxiudahui5.txt)  # 解压后替换为下载路径

数据将定期更新,未来也会根据国务院的行政区划调整进行重新抓取。

JioNLP 是一个专注挖掘并分析互联网数据的gong—zhong号,还想要什么数据集?来看看这里有没有你想要的数据吧。

本文由多平台发布

本文由多平台发布

经验分享 程序员 微信小程序 职场和发展