中文情感分析语料库下载:ChnSentiCorp、weibo_senti_100k
原因在于:这个领域的中文数据是 AI 方向里最成熟的一批。GitHub、百度飞桨、阿里天池、Hugging Face 上都能搜到大量"中文情感语料库""评论数据集"。问题恰恰出在这里——同一个名字会出现在多个不同的地方,版本不一样、标注方式不一样、条数不一样,甚至能不能商用都没写清楚。你拿到的到底是哪个版本?标注的是"好评/差评"还是"开心/愤怒/悲伤"?这些信息一旦混淆,训练出来的模型就难以可用。
所以在动手前,先明确需求:你要的是哪类情感?两分类还是多分类?用于研究还是商用?想清楚再开始。下面把真实能找到、能下载的一手来源筛出来,按"最省事"到"最权威但流程较长"的顺序逐一梳理。
一、入门首选:一个大仓库打包了多份
如果你想先取得数据快速上手,最省事的办法是去 GitHub 找一个名为 SophonPlus/ChineseNlpCorpus 的仓库(https://github.com/SophonPlus/ChineseNlpCorpus)。该仓库把多份中文情感语料整理到了一起,全部为 CSV 格式(Excel 即可打开),直接 clone 即可下载。其中常用、质量也比较稳定的有以下几份:
- ChnSentiCorp(酒店评论):约 7000 多条,好评差评二分类,是中文情感分析的"行业基准线",常被作为入门起点。
- weibo_senti_100k(新浪微博):10 万多条,正向和负向各一半,比例均衡,适合做两分类训练。下载入口页在此:https://github.com/SophonPlus/ChineseNlpCorpus/blob/master/datasets/weibo_senti_100k/intro.ipynb
- simplifyweibo_4_moods(微博,四种情绪):36 万多条,标注为"喜、怒、恶、乐"四类。如果你需要做多分类,这个体量足够使用。
- waimai_10k(外卖评论):1 万条左右,负面偏多(约 8000 负、4000 正),适合分析差评集中在哪些问题的场景。
- online_shopping_10_cats(电商评论):10 个品类共 6 万多条,两分类,正负各半。
- dmsc_v2(豆瓣电影)、yf_dianping(餐饮)、yf_amazon:这三份都是"打分+评论",可以直接拿评分当弱标注,例如 5 星算正、1 星算负。体量很大(200 万到 700 万条),但数据质量一般,需要自行清洗。
⚠️ 特别提醒:这些数据绝大多数是研究者从微博、豆瓣、电商抓取的,严格说版权属于平台,仅适合用于学术研究和学习。仓库中很多没有附正式的 LICENSE 文件,因此如果你打算将这些数据用于商业应用,需自行评估合规风险。
二、想直接上手训练模型?Hugging Face 上有现成的切分版
如果你已经能编写代码,想直接加载数据开始训练,Hugging Face 上有一些版本已经切好了"训练、验证、测试"三份,一行 load_dataset 即可使用,无需自行拆分。
- lansinuote/ChnSentiCorp(https://huggingface.co/datasets/lansinuote/ChnSentiCorp):约 12000 条,训练/验证/测试已切分。注意这个条数与 GitHub 上的 7000 多条不一致——同一个名字未必是同一份数据,使用前务必核对清楚。
- seamew/ChnSentiCorp(https://huggingface.co/datasets/seamew/ChnSentiCorp):另一个常用版本,格式为 arrow,同样已切分,使用前需核对版本。
- t1annnnn/Chinese_sentimentAnalyze(https://huggingface.co/datasets/t1annnnn/Chinese_sentimentAnalyze):合并了微博和购物评论,约 18.3 万条,训练/验证/测试齐全,适合做更大规模的两分类训练。
三、需要学术权威来源?这些评测集质量好,但多半需要申请
如果你追求高精度、研究级,或者想与论文做对比,那需要走官方评测集的路子。这些数据质量最高、标注更细,但通常需要官方申请、甚至当年报名比赛才能取得,不是点击即可下载。
- SMP2020-EWECT(微博情绪分类)(https://smp2020ewect.github.io/):6 类情绪标注(积极/愤怒/悲伤/恐惧/惊奇/无情绪),有通用版和疫情版,需遵循官方使用条款。
- NLPCC 2014 / 2013(中文微博情感分析)(http://tcci.ccf.org.cn/conference/2014/pages/page04_sam.html,http://tcci.ccf.org.cn/conference/2013/pages/page04_sam.html):7 类细粒度情绪,XML 格式。样例可以下载,完整数据集偏学术用途,如无法取得,可使用下面的转存仓库。
- DinghaoXi/chinese-sentiment-datasets(https://github.com/DinghaoXi/chinese-sentiment-datasets):这个 GitHub 仓库整理转存了 NLPCC 2013/2014 的数据。需注意转存版不保证与官方完全一致,使用前需自行核对。
四、国内平台:访问稳定,但需注册
如果访问国外网站较慢,也有国内可直接使用的来源。
- 百度飞桨 AI Studio:搜索"ChnSentiCorp"(https://aistudio.baidu.com/datasetdetail/158737)或"SMP2020-EWECT"(https://aistudio.baidu.com/projectdetail/3803173),国内网络可直接访问,但需注册登录才能下载。
- 阿里云天池(https://tianchi.aliyun.com/dataset/88766):四个领域(笔记本、汽车、相机、手机)的二分类中文评论,需登录下载。
五、找不到对口数据?先查这几个导航站
有时你需要的数据较为冷门,或者明知存在却找不到下载入口。这时不必盲目尝试,先到以下导航站对一下口径:
- ChineseNLP(滴滴维护)(https://chinesenlp.xyz/docs/sentiment_analysis.html):情感分析篇,把主流数据集列得清晰,包括任务定义、类别、数据说明。可先看这个,再决定去哪查找。
- Papers with Code · ChnSentiCorp(已关停·作历史参考):该站已于 2025 年 7 月被 Meta 关停、域名跳转 Hugging Face;查看模型榜单和论文配套数据,改用 Hugging Face Papers、GitHub。
- Kaggle:搜索"weibo sentiment analysis"或"Chinese sentiment",部分数据在国际镜像上有备份(https://www.kaggle.com/datasets/zhuflower/weibo-sentiment-analysis/code),同样需登录下载。
六、最大的坑:同一个名字,不是同一份数据
常见的问题是:下载了一份"ChnSentiCorp",却发现条数对不上、标注方式也不一样。有些只有 1000 多条,有些是 7000 多,有些是 12000 的切分版。标注体系也各不相同:有的是"好评/差评",有的是"4 类情绪",有的是 6 类、7 类细粒度。
使用前务必核对清楚:将来源、版本号、标注体系逐一确认,避免误用数据而不自知。如不放心,最稳妥的办法是从上面的"SophonPlus/ChineseNlpCorpus"和 Hugging Face 的官方页面重新下载一份,不要使用网盘里来源不明的"下载地址"。
七、数据太散、太乱,不想逐一核对?
大多数人真正卡住的,不是"有没有数据",而是"数据散在多个平台,版本口径对不上,评测集要申请,原站已经下线"。仅仅核实"这个数据集到底能不能下载、标注是什么、能不能商用",就可能花掉大半天时间。
如果你想一步到位,可以让我们帮你做一次数据可得性深度检索。我们的工作是:把你需要的任务(例如两分类好评差评、多类情绪、属性级细粒度)拿来,与 GitHub、Hugging Face、百度飞桨、阿里天池、CCF 官方评测站等一手来源逐一比对,最后给你一张清晰的表:哪些可以直接下载、哪些需要注册、哪些需走申请、哪些原站已下线只能找镜像。对每份数据,我们都会如实说明"标注体系是什么、版本是哪版、能不能商用",不夸大、不承诺一定能下。对于无法取得的数据,我们也会如实说明并给出替代路径,而不会含糊其辞。
数聚天成 DeepSData 做的正是这件事——不是直接给你一套数据,而是帮你在分散的来源中找到最可靠的几份,让你的选择有据可依。
说明:本文为公开资料整理,仅供参考;平台政策、价格、下载方式与链接随时可能变化,本文不保证持续更新,请以各官方页面最新信息为准。
参考来源
- https://github.com/SophonPlus/ChineseNlpCorpus
- https://github.com/SophonPlus/ChineseNlpCorpus/tree/master/datasets
- https://github.com/SophonPlus/ChineseNlpCorpus/blob/master/datasets/weibo_senti_100k/intro.ipynb
- https://huggingface.co/datasets/lansinuote/ChnSentiCorp
- https://huggingface.co/datasets/seamew/ChnSentiCorp
- https://huggingface.co/datasets/t1annnnn/Chinese_sentimentAnalyze
- https://smp2020ewect.github.io/
- http://tcci.ccf.org.cn/conference/2014/pages/page04_sam.html
- http://tcci.ccf.org.cn/conference/2013/pages/page04_sam.html
- https://github.com/DinghaoXi/chinese-sentiment-datasets
- https://aistudio.baidu.com/datasetdetail/158737
- https://aistudio.baidu.com/projectdetail/3803173
- https://tianchi.aliyun.com/dataset/88766
- https://paperswithcode.com/sota/chinese-sentiment-analysis-on-chnsenticorp
- https://www.kaggle.com/datasets/zhuflower/weibo-sentiment-analysis/code
- https://chinesenlp.xyz/docs/sentiment_analysis.html
- https://tech.meituan.com/2019/01/25/ai-challenger-2018.html
