中文文本分类数据集下载与来源:THUCNews、CLUE、ChineseNlpCorpus

主要来源分布

中文文本分类数据,主要分布在三类来源:

  • 新闻类数据(财经、体育、科技、娱乐等):最经典的有清华的 THUCNews、搜狗新闻语料、今日头条的标题数据。
  • 评论/情感类数据(好评差评、电商外卖评论):GitHub 上有整理好的合集,CSV 格式,可直接下载,适合好评/差评这类二分类任务。
  • 综合评测基准中的现成子集:如 CLUE(中文语言理解评测)打包了多个可直接使用的小数据集。

下面逐个列出真实来源,并说明哪些可免费下载、哪些需要注册、哪些仅限学术使用。


逐个来源说明

1. 新闻分类的经典集:THUCNews(清华)

  • 是什么:清华大学 NLP 实验室整理的新浪新闻数据,约 74 万篇、14 个类别(财经、体育、科技、娱乐等),纯文本格式,体量约 2GB 以上。是中文新闻分类最常被引用的基准数据集。
  • 官方入口:http://thuctc.thunlp.org/

(提供工具包和数据申请入口)

  • 便捷镜像:https://huggingface.co/datasets/seamew/THUCNews

(Hugging Face 上的镜像,有一定技术基础可一键加载;最终授权仍以原始集为准)

  • 注意:官方写明仅供学术/研究使用。能否商用、能否再分发,需查看官方授权页,不宜默认可随意使用

2. 中文评测基准中的现成子集:CLUE

CLUE(中文语言理解评测基准)打包了多个可直接用于文本分类的数据集:

  • TNEWS:今日头条短新闻分类,约 26.6 万条训练数据、15 个类别。
  • IFLYTEK:APP 应用描述的长文本分类,1.7 万多条样本、119 个类别。
  • CSLDCP:中文科学文献的学科分类,67 个类别。
  • EPRSTMT:电商评论的二分类情感(好评/差评,属于小样本任务)。
  • 官方 GitHub:https://github.com/CLUEbenchmark/CLUE

(含基准说明和基线代码)

  • 可加载镜像:https://huggingface.co/datasets/clue

(tnews、iflytek 等子集,json/parquet 格式)

  • 数字核对:https://www.cluebenchmarks.com/introduce.html

(各任务定义、训练/验证/测试规模,类别数和样本量以此页为准)

  • 注意:主要面向研究用途,各子集的许可以原始页面为准。

3. 评论/情感分类常用合集:ChineseNlpCorpus

  • 是什么:GitHub 上整理好的中文情感/评论分类合集,CSV 格式,开源、可直接下载,适合好评/差评二分类的入门使用。包含:
  • ChnSentiCorp:酒店评论二分类
  • waimai_10k:外卖评论约 1.2 万条(好评约 4 千、差评约 8 千)
  • online_shopping_10cats:10 类商品共 6 万多条评论(好评差评各约 3 万)
  • weibo_senti_100k:新浪微博 10 万多条(好评差评各约 5 万)
  • 地址:https://github.com/SophonPlus/ChineseNlpCorpus

4. 今日头条新闻标题分类:toutiao 数据集

  • 是什么:约 38 万条头条新闻、15 个类别。字段用 _!_ 分隔(新闻 ID、类别码、类别名、标题、关键词),纯文本,可直接下载。
  • 地址:https://github.com/fate233/toutiao-text-classfication-dataset

5. 搜狗新闻语料库 SogouCS(搜狗实验室)

  • 是什么:XML 格式的新闻语料,依靠网址(url)推断频道来做分类。精简版约一两百个文本文件,完整版解压约 3.3GB。
  • 地址:https://www.sogou.com/labs/resource/cs.php
  • 注意:这个数据集使用门槛较高——文件是 ANSI/XML 编码,需要先做编码转换和解析(对非技术用户不够友好)。另外,部分版本需要先注册、同意协议才能下载,以官方页面为准

6. 国内综合平台(需登录,数据集随平台变动)

下面几个是国内可直接访问的数据平台,其中也有中文文本分类/情感分析的数据集。但通常需要登录(部分需实名),且具体内容和规模会随平台更新变化。以下仅供参考,请以平台实时页面为准

  • 阿里云天池:https://tianchi.aliyun.com/dataset/

(含 NLP 新闻分类等数据集和学习赛)

  • 百度飞桨 AI Studio:https://aistudio.baidu.com/datasetoverview

(含中文新闻标题分类等,多与项目/比赛绑定)

  • 和鲸社区 Heywhale:https://www.heywhale.com/home

(国内数据科学社区,有文本分类/情感分析数据集和示例笔记本)

7. 国际平台入口(需要对应账号)

  • Kaggle:https://www.kaggle.com/code/gpreda/chinese-text-classification

(国际平台上的中文文本分类示例和配套数据,需要 Kaggle 账号)

8. 学术付费/受限库(个人一般无法下载)

这两个库中有不少高质量的中文文本语料,但主要依靠高校图书馆订阅或机构付费/申请,个人很难免费直接下载,适合有校园网或机构账号的科研人员:

  • CSMAR(国泰安/希施玛):https://data.csmar.com/

(含财经新闻、舆情文本)

  • CnOpenData:https://www.cnopendata.com/

(含人民日报文本、A 股新闻舆情、省市官方报纸等)


找到相关数据后,还需要继续核验或整理?先查看相关说明卡;没有合适数据,或现成数据不能直接使用时,可以继续检索、来源核验、整理或定制。新用户注册可先体验标准检索评估。
提交数据需求 →

获取难度:三档划分

按获取难度,将上述来源分为三档:

  • 可直接免费下载:ChineseNlpCorpus 评论合集、今日头条标题数据集,以及 THUCNews 和 CLUE 子集的 Hugging Face 镜像(有技术基础可一键加载)。
  • 免费但有一定门槛:THUCNews 官方入口(需注意学术授权)、搜狗 SogouCS(需编码转换、部分版本需注册同意协议)、天池/飞桨/和鲸(需登录、部分需实名)。
  • 付费或机构限定:CSMAR、CnOpenData,个人基本无法下载,需依靠学校或单位账号。

需要提前注意的几点:

  • 网盘链接容易失效:网上常被转发的“复旦中文文本分类语料”这类链接,往往走百度网盘、带提取码,时间一长容易失效。这类链接是否可用、数字是否准确,均以发布方当前页面为准。
  • 找不到时的替代路径
  • 官方集打不开 → 查找 Hugging Face 上的镜像(如 THUCNews 的 seamew 镜像)。
  • 网盘链接失效 → 转去 CLUE 中查找同类的现成子集(如需新闻分类可用 TNEWS)。
  • 评论情感数据没有合适来源 → 直接用 ChineseNlpCorpus 这个整理好的合集起步。

使用前注意:许可与合规

  • 先看许可,不应想当然使用:THUCNews、搜狗语料、复旦语料这类,很多写明“仅供学术研究”。能否商用、能否再分发,需逐个查看各自官方授权页,以官方页面为准
  • 新闻和评论原文有版权:这些数据中的新闻正文、用户评论本身是受版权保护的内容。自行研究、模型练习一般没有问题,但如需商用、对外发布或二次分发,务必先确认授权,避免版权风险。
  • 国内平台需查看平台条款:天池、飞桨、和鲸上的数据集各有使用条款,下载前请留意平台和发布者的说明。

来源零散时的服务支持

中文文本分类的数据,实际情况是“来源很多但较为零散,获取难度差别很大”。新闻分类和评论情感是两套完全不同的数据,经典集分散在高校实验室网页、GitHub、网盘和 Hugging Face 镜像中,学术付费库又是另一档。逐个核对许可、确认能否下载,确实较为费时。

如果你不想自行逐个查找,我们的服务可以提供支持:数聚天成 DeepSData 可以做一次深度数据可得性检索——跨这些零散来源,逐个查清“有什么、什么格式、许可怎样、是否需要登录或付费”,最后给出一个诚实的判断:这份数据是直接免费下载、需要校园网、还是只能申请。命中时会给出获取路径,未命中时也会提供替代方案。我们替你完成“广泛检索 + 如实交底”这部分工作,但最终的许可核对,仍建议你到官方页面确认,外链也不保证长期有效。

如有需要,告诉我们你想找什么、必须满足哪些条件即可。


本文仅作公开来源整理和可得性参考,不构成医疗、法律、投资、商业决策或合规意见;正式使用前请以官方页面、授权条款和专业意见为准。

说明:本文为公开资料整理,仅供参考;平台政策、价格、下载方式与链接随时可能变化,本文不保证持续更新,请以各官方页面最新信息为准。