数据集去哪找:国内+国际公开数据网站汇总(免费/付费/受限)

国内常用数据平台(无需特殊网络环境,注册即可使用)

以下几个平台是国内进行数据分析、训练 AI 模型时较常使用的来源,对入门用户较为友好。

该平台提供上千个开放数据集,涵盖图像、语音、文本等类型。注册账号即可使用,基本免费,适合入门练习。

  • 阿里云天池:这是一个竞赛平台,其数据的主要特点是贴近真实业务场景,例如电商、金融、物流等领域。如需接近真实业务的数据用于测试,可以考虑该平台。
  • 和鲸社区(Kesci):涵盖金融、社交、电商、医疗等多个领域的数据。其便利之处在于自带在线分析工具,下载数据后无需切换环境即可直接运行。

关于天池和和鲸的具体定位,可参考知乎上的讨论(https://www.zhihu.com/question/399674482);具体的数据集数量与收费方式,请以各平台官网的最新说明为准。

面向大模型、多模态数据的平台

该平台专门面向大模型,收集了大量文本和图片数据。根据官方说法,其已收录数千个开源数据集,注册后即可下载,具体数量以官网页面为准。如需大量语料用于大模型开发,该平台是优先选择之一。

经管、金融、学术类数据(质量较高,获取门槛也较高)

这类数据专业性强,但通常无法免费获取全部内容。

涵盖经济、金融、会计、法律、地理、新闻等 500 多个专题库。部分免费,部分需付费或存在使用限制,具体以各专题库页面的标注为准。

需要注意,它本质上是高校图书馆订阅的付费资源,通常需要在校园网范围内、使用真实姓名和学校信息注册才能使用。个人用户较难免费获取全部数据

政府官方公开数据(权威、免费,建议优先考虑)

进行严肃分析时,这类数据的可靠性较高。

可查询月度、季度、年度及普查数据,免费查询,部分功能需要注册。

提供数据发布、普查数据、中国统计年鉴等入口,全部免费。

找到相关数据后,还需要继续核验或整理?先查看相关说明卡;没有合适数据,或现成数据不能直接使用时,可以继续检索、来源核验、整理或定制。新用户注册可先体验标准检索评估。
提交数据需求 →

国际权威数据源(质量较高,访问体验可能不稳定)

以下网站均为境外平台,数据质量较高,但在国内访问速度可能较慢。

提供海量数据集,以文本类为主,大部分免费,其定位类似于托管数据的“GitHub”。需要注意,每个数据集都有各自的使用许可,部分需要先同意条款或提交申请才能下载。

老牌数据科学竞赛平台,提供大量公开数据集,并自带免费的在线运行环境。使用需要注册,但个别竞赛的数据存在禁止再分发的限制,请勿随意转发。

  • Papers with Code(已于 2025 年关停·作历史参考):该平台曾按任务领域将论文与配套代码、数据归类整理,便于论文复现;目前已被 Meta 关停,域名跳转至 Hugging Face。如需查找论文配套的代码或数据,建议优先使用 Hugging Face 以及 GitHub 上论文的官方仓库。

由欧洲核子研究中心(CERN)支持的通用开放仓库。每份数据均带有 DOI 号(便于论文引用),适合存取论文的配套数据,免费。

提供 2000 多个时间序列数据,例如世界发展指标等,支持 CSV、Excel 和 API 下载,全部免费开放。如需进行跨国对比,可优先考虑该来源。

医疗、生理信号类数据(典型的“可获知但难获取”)

这是一个生理与医疗信号数据库,按访问权限分为三档:

  • Open Access:几乎没有限制,可直接使用。
  • Restricted Access:需要注册并签署数据使用协议(DUA)。
  • Credentialed Access(例如著名的 MIMIC 数据库):需先完成 CITI 的人类研究与数据隐私培训,上传培训报告并等待审核通过(一般在数天内),再签署 DUA。此外需每人单独申请,不能由团队或课堂共用一个账号。申请前的培训要求可参见:https://physionet.org/about/citi-course/

按获取难易程度的归类

  • 可直接下载(最便捷):飞桨 AI Studio、国家统计局、地方政府开放平台、World Bank、PhysioNet 的 Open Access 部分。
  • 需注册/查看许可:Hugging Face、Kaggle、OpenDataLab、Zenodo。平台免费,但单个数据集可能有各自的使用规则。
  • 需付费/校园账号:CSMAR 国泰安、CnOpenData 的部分专题库。个人用户基本无法免费获取全部内容。
  • 需走受限流程:PhysioNet 的 MIMIC 等数据,涉及培训、签署协议和审核,如有时间需求请预留足够时间。

数据分散、难以查找时的建议

上述来源虽多,但实际使用中会发现,不少数据“可获知但难获取”——或需付费,或存在培训要求。同时,逐个平台手动查找效率较低,也容易出现遗漏。

如果你有明确的数据需求,又不希望在多个平台间反复查找,或难以判断某项数据能否获取,可以尝试使用数聚天成 DeepSData。它可以为你完成一次深度数据可得性检索,跨国内通用平台、政府官方源与国际权威库统一查询,进行去重并标注来源,最终给出客观判断:该数据能否获取,是免费直接下载、需注册付费,还是需走受限流程。如果未能找到,它也会说明原因是数据本身不存在或未公开,并提供近似数据来源与替代方向。它不承诺“一定找得到”,只如实告知“能否获取、如何获取”,帮助你减少逐个平台试错的工作量。

说明:本文为公开资料整理,仅供参考;平台政策、价格、下载方式与链接随时可能变化,本文不保证持续更新,请以各官方页面最新信息为准。