数据集去哪找:国内+国际公开数据网站汇总(免费/付费/受限)
国内常用数据平台(无需特殊网络环境,注册即可使用)
以下几个平台是国内进行数据分析、训练 AI 模型时较常使用的来源,对入门用户较为友好。
- 百度飞桨 AI Studio 星河社区:https://aistudio.baidu.com/datasetoverview
该平台提供上千个开放数据集,涵盖图像、语音、文本等类型。注册账号即可使用,基本免费,适合入门练习。
- 阿里云天池:这是一个竞赛平台,其数据的主要特点是贴近真实业务场景,例如电商、金融、物流等领域。如需接近真实业务的数据用于测试,可以考虑该平台。
- 和鲸社区(Kesci):涵盖金融、社交、电商、医疗等多个领域的数据。其便利之处在于自带在线分析工具,下载数据后无需切换环境即可直接运行。
关于天池和和鲸的具体定位,可参考知乎上的讨论(https://www.zhihu.com/question/399674482);具体的数据集数量与收费方式,请以各平台官网的最新说明为准。
面向大模型、多模态数据的平台
- OpenDataLab(上海 AI 实验室):https://opendatalab.com/
该平台专门面向大模型,收集了大量文本和图片数据。根据官方说法,其已收录数千个开源数据集,注册后即可下载,具体数量以官网页面为准。如需大量语料用于大模型开发,该平台是优先选择之一。
经管、金融、学术类数据(质量较高,获取门槛也较高)
这类数据专业性强,但通常无法免费获取全部内容。
- CnOpenData:https://www.cnopendata.com/
涵盖经济、金融、会计、法律、地理、新闻等 500 多个专题库。部分免费,部分需付费或存在使用限制,具体以各专题库页面的标注为准。
- CSMAR 国泰安(现更名为深圳希施玛):这是中国股市与会计研究领域的老牌数据库。相关介绍可参考清华经管学院的页面(https://www.sem.tsinghua.edu.cn/info/1164/12168.htm)。
需要注意,它本质上是高校图书馆订阅的付费资源,通常需要在校园网范围内、使用真实姓名和学校信息注册才能使用。个人用户较难免费获取全部数据。
政府官方公开数据(权威、免费,建议优先考虑)
进行严肃分析时,这类数据的可靠性较高。
- 国家数据(国家统计局数据库):https://data.stats.gov.cn/
可查询月度、季度、年度及普查数据,免费查询,部分功能需要注册。
- 国家统计局·数据:https://www.stats.gov.cn/sj/
提供数据发布、普查数据、中国统计年鉴等入口,全部免费。
- 地方公共数据开放平台:目前全国已有 20 多个省市上线此类平台,大部分支持免费下载,部分需要注册。
- 上海:https://data.sh.gov.cn/
- 北京:https://data.beijing.gov.cn/
- 杭州:https://data.hangzhou.gov.cn/index.html
- 如需查找其他省市,可参考第三方汇总的索引(https://www.cnblogs.com/mo3408/p/17499119.html)。需要说明的是,具体网址、数据及字段口径,请以各平台官网的最新情况为准。
国际权威数据源(质量较高,访问体验可能不稳定)
以下网站均为境外平台,数据质量较高,但在国内访问速度可能较慢。
- Hugging Face(数据集部分):https://huggingface.co/datasets
提供海量数据集,以文本类为主,大部分免费,其定位类似于托管数据的“GitHub”。需要注意,每个数据集都有各自的使用许可,部分需要先同意条款或提交申请才能下载。
- Kaggle(数据集部分):https://www.kaggle.com/datasets
老牌数据科学竞赛平台,提供大量公开数据集,并自带免费的在线运行环境。使用需要注册,但个别竞赛的数据存在禁止再分发的限制,请勿随意转发。
- Papers with Code(已于 2025 年关停·作历史参考):该平台曾按任务领域将论文与配套代码、数据归类整理,便于论文复现;目前已被 Meta 关停,域名跳转至 Hugging Face。如需查找论文配套的代码或数据,建议优先使用 Hugging Face 以及 GitHub 上论文的官方仓库。
- Zenodo:https://zenodo.org/
由欧洲核子研究中心(CERN)支持的通用开放仓库。每份数据均带有 DOI 号(便于论文引用),适合存取论文的配套数据,免费。
- World Bank Open Data(世界银行):https://data.worldbank.org/
提供 2000 多个时间序列数据,例如世界发展指标等,支持 CSV、Excel 和 API 下载,全部免费开放。如需进行跨国对比,可优先考虑该来源。
医疗、生理信号类数据(典型的“可获知但难获取”)
- PhysioNet:https://physionet.org/about/database/
这是一个生理与医疗信号数据库,按访问权限分为三档:
- Open Access:几乎没有限制,可直接使用。
- Restricted Access:需要注册并签署数据使用协议(DUA)。
- Credentialed Access(例如著名的 MIMIC 数据库):需先完成 CITI 的人类研究与数据隐私培训,上传培训报告并等待审核通过(一般在数天内),再签署 DUA。此外需每人单独申请,不能由团队或课堂共用一个账号。申请前的培训要求可参见:https://physionet.org/about/citi-course/
按获取难易程度的归类
- 可直接下载(最便捷):飞桨 AI Studio、国家统计局、地方政府开放平台、World Bank、PhysioNet 的 Open Access 部分。
- 需注册/查看许可:Hugging Face、Kaggle、OpenDataLab、Zenodo。平台免费,但单个数据集可能有各自的使用规则。
- 需付费/校园账号:CSMAR 国泰安、CnOpenData 的部分专题库。个人用户基本无法免费获取全部内容。
- 需走受限流程:PhysioNet 的 MIMIC 等数据,涉及培训、签署协议和审核,如有时间需求请预留足够时间。
数据分散、难以查找时的建议
上述来源虽多,但实际使用中会发现,不少数据“可获知但难获取”——或需付费,或存在培训要求。同时,逐个平台手动查找效率较低,也容易出现遗漏。
如果你有明确的数据需求,又不希望在多个平台间反复查找,或难以判断某项数据能否获取,可以尝试使用数聚天成 DeepSData。它可以为你完成一次深度数据可得性检索,跨国内通用平台、政府官方源与国际权威库统一查询,进行去重并标注来源,最终给出客观判断:该数据能否获取,是免费直接下载、需注册付费,还是需走受限流程。如果未能找到,它也会说明原因是数据本身不存在或未公开,并提供近似数据来源与替代方向。它不承诺“一定找得到”,只如实告知“能否获取、如何获取”,帮助你减少逐个平台试错的工作量。
说明:本文为公开资料整理,仅供参考;平台政策、价格、下载方式与链接随时可能变化,本文不保证持续更新,请以各官方页面最新信息为准。
参考来源
- https://aistudio.baidu.com/datasetoverview
- https://www.zhihu.com/question/399674482
- https://opendatalab.com/
- https://www.cnopendata.com/
- https://www.sem.tsinghua.edu.cn/info/1164/12168.htm
- https://data.stats.gov.cn/
- https://www.stats.gov.cn/sj/
- https://data.sh.gov.cn/
- https://data.beijing.gov.cn/
- https://data.hangzhou.gov.cn/index.html
- https://huggingface.co/datasets/J0nasW/paperswithcode
- https://www.kaggle.com/datasets/nbroad/hf-ds/versions/184/code
- https://data.worldbank.org/
- https://physionet.org/about/database/
- https://physionet.org/about/citi-course/
- https://www.cnblogs.com/mo3408/p/17499119.html
