做研究数据去哪找:国家统计局、世界银行、Kaggle 等真实来源清单

先说一个基本判断:数据其实大多有处可寻,但分散在众多来源,每个来源的"进门条件"各不相同。 有的注册即可免费下载,有的需要机构订阅(如国泰安、CNKI 这类高价数据库),有的像世界银行那样连商用都允许,且不收费。好不好找,最终取决于你要的是哪一类。下面按类别逐一说明:哪些容易获取、哪些门槛较高,以及找不到时该怎么办。


国内官方数据:优先检索,免费且权威

国家统计局·国家数据data.stats.gov.cn

提供官方的月度、季度、年度数据,涵盖人口普查、国际对比、统计年鉴等。网页上可直接查询并导出 Excel,免费使用。部分功能需要登录,但门槛很低。配套总入口为 stats.gov.cn/sj/,普查数据、年鉴均可从此进入。

这一来源的优点是权威、稳定、不会突然下线,适合作为首选。需要注意的是数据发布通常比新闻滞后一个月左右,对时效性要求高的场景不宜依赖。


地理/遥感类:注册免费,需掌握检索方法

地理空间数据云gscloud.cn

由中科院提供,注册登录后可免费下载 Landsat、Sentinel、MODIS、高程(DEM)等遥感影像。初次使用时界面上会显示密集的地图网格,不易上手。建议使用"高级检索",按所需的区域、时间范围、云量大小进行筛选,否则一个区域会下载到大量无用影像。如不做筛选,容易下载到大量被云层遮挡、无法使用的影像。

中科院资源环境科学与数据中心resdc.cn

专门提供土地利用、气象、人口 GDP 栅格、行政区划等专题数据。注册会员后每天可免费下载 1 个(信息填写完整后最多 5 个)。需注意:部分数据可能还需单独申请,以页面说明为准。


机器学习/AI 训练数据:注册即可使用,多数免费

如果你从事模型训练,以下几个平台可优先考虑:

  • 和鲸社区heywhale.com/home/dataset)——国内的数据科学协作平台,拥有 5000G+ 数据集,含部分科研机构的独家数据。注册即可使用。需注意:放在 project 路径的文件才能下载,放在 input 路径的仅供查看、不可下载。
  • 阿里云天池tianchi.aliyun.com/dataset/)——覆盖电商、医疗、工业等十多个行业,学习赛中的数据多数为公开免费。但每个数据集的许可不同,下载前请先查看页面说明,部分不允许商用。
  • 百度飞桨 AI Studioaistudio.baidu.com/datasetoverview)——提供上千个开放数据集,涵盖图像、文本、语音,并免费提供 GPU 算力,注册即可领取。适合入门练习。

财经/经济数据库:质量高,但多数需机构订阅

这是获取难度较高的一类。数据质量好,但个人通常难以直接获取。

  • CSMAR 国泰安gtarsc.com)——国内规模最大的财经数据库之一,涵盖股票、公司、基金、宏观经济等。主要面向高校和科研机构订阅,个人一般只能通过学校图书馆访问。新网址常为 data.csmar.com,以官方为准。个人用户若需查询某家公司的财务数据,多数情况下需通过校内网或机构权限获取。
  • CnOpenDatacnopendata.com)——拥有 50 多个专题库,包括专利、上市公司、工商注册企业(数据量超过 3.5 亿条)等。部分免费、部分需购买或定制。如果你是中小企业需要查询某些行业数据,可先评估免费部分是否够用。
  • CNKI 中国经济社会大数据研究平台data.cnki.net)——收录统计年鉴 2589 种,每周更新。多数高校已订购,个人一般需通过机构访问。没有学校账号则较难使用。

国际经济/金融数据:权威、免费,部分可商用

这一类来源质量较高,值得重点关注。

  • 世界银行开放数据data.worldbank.org)——提供 1400 多个发展指标,涵盖 GDP、贫困、健康、教育、气候、贸易等。全部采用 CC-BY 4.0 许可,可以商用,只需按要求署名。提供 CSV、Excel 直接下载,并配有 API。适合用于商业报告等场景,数据来源稳定。
  • IMF 数据imf.org/en/data)——核心是《世界经济展望》(WEO),每年 4 月和 10 月发布,数据自 1980 年至今,并附未来 5 年预测。可免费下载电子表格,也提供 API。适合宏观经济分析。

提示:部分国际站点在国内访问速度可能较慢,建议先确认能否正常连接。


找到相关数据后,还需要继续核验或整理?先查看相关说明卡;没有合适数据,或现成数据不能直接使用时,可以继续检索、来源核验、整理或定制。新用户注册可先体验标准检索评估。
提交数据需求 →

学术/医学数据:数量大,但许可需逐个核对

  • Hugging Face Datasetshuggingface.co/datasets)——50 万+ 公开数据集,覆盖 NLP、图像、音频,可一键加载。许可写在每个数据集的 README 中,必须逐个核对——部分为私有数据,使用不当即构成侵权。
  • Kaggle Datasetskaggle.com/datasets)——竞赛和社区数据集,多数为 CSV/JSON,可直接下载。许可差异很大,从完全公开到"仅限教育用途、不可商用"均有。使用前务必查看 License 页面,并按要求引用。
  • Zenodoabout.zenodo.org)——由欧洲核子研究中心运营,每条数据均提供 DOI 编号,适合查找论文配套数据。免费上传下载,单文件最大 50GB。
  • PhysioNetphysionet.org)——提供生理和临床数据,如知名的 MIMIC 数据集。并非注册即可下载:需先完成人类研究培训(CITI),再签署数据使用协议,且不得转手分享、不得上传至第三方 AI 接口。审批耗时可能较长,需预留时间。

已停止运营的来源:无需再查

Papers with Codepaperswithcode.com)曾是机器学习 SOTA 排行榜、数据集与代码的聚合站,但已于 2025 年 7 月被 Meta 关闭,域名现跳转至 Hugging Face 论文页。网上出现的 paperswithcode2.com 为非官方接续站,不建议采用。请以现状为准,不再推荐使用。


找不到数据怎么办:推荐的检索顺序

检索数据建议按以下顺序进行,避免盲目尝试:

  1. 先查官方源——统计局、世界银行、IMF,权威、稳定、免费。
  2. 再找学术仓库——Zenodo、Hugging Face,论文配套数据常见于此。
  3. 然后看竞赛平台——天池、Kaggle、飞桨、和鲸,练习数据与近似数据较多。
  4. 确实没有,再考虑定制——如 CnOpenData 提供定制服务,但需有相应预算。

需要说明的是:很多时候找不到数据,并非检索不够充分,而是该数据本身从未公开。 例如某些特定行业的统计数据,投入大量时间检索后仍可能发现无人公开。与其勉强用一个不对路的数据替代,不如如实说明:该方向目前没有公开来源,只能自行收集或等待日后开放。


使用前先确认许可

  • 同一平台内,不同数据集的许可可能差异巨大。 Kaggle 上有的可自由使用,有的仅限教育用途,用于商业即属违规。
  • 世界银行的 CC-BY 4.0 可以商用,但必须署名。 许多数据集为"非商用"或"仅教育用",商业项目使用前需谨慎核对。
  • 受限数据须遵守约定。 如 PhysioNet,签署协议后不得转手分享、不得上传至第三方 AI 接口,否则即属违规。
  • 引用要规范。 使用他人数据集时,按其要求正确引用,既是合规要求,也是学术诚信的体现。

如果检索一遍仍无头绪,或不想逐个尝试

上述来源分散在十几个网站,许可与门槛各不相同,逐个检索较为耗时。例如有客户需要做某个行业的竞争分析,检索了国家统计局、天池、Kaggle 后,发现数据要么不齐全、要么不对路。

在这种情况下,数聚天成 DeepSData 可以提供协助:我们可以围绕你的具体研究题目,将这些国内外来源系统检索一遍,如实说明——哪些可直接免费下载、哪些需要注册、哪些需机构订阅或付费定制、哪些需申请资质,以及找不到时还有哪些替代路径。我们追求检索的广度和深度,并把许可和门槛说明清楚;但不保证某一条具体数据一定能找到——找不到往往是因为该数据本身未公开。是否使用、如何使用,决定权始终在你。

这样可以为你节省反复检索的时间,把精力集中在研究本身。


本文仅作公开来源整理和可得性参考,不构成医疗、法律、投资、商业决策或合规意见;正式使用前请以官方页面、授权条款和专业意见为准。

说明:本文为公开资料整理,仅供参考;平台政策、价格、下载方式与链接随时可能变化,本文不保证持续更新,请以各官方页面最新信息为准。