医疗NLP数据集去哪找下载:CBLUE、CMeEE 等中文医疗语料来源
本文把中文医疗NLP语料的常见来源和准入门槛梳理清楚,帮助你直接定位到对自己有用的数据。
先分清楚你要的是“训练语料”还是“统计报表”
这是医疗NLP选数据时最常见的误区。
通常说的“医疗数据”分为两类,用途差别很大:
- 训练文本语料:用于训练模型,让它学会识别“咳嗽”“肺炎”“阿莫西林”这些词之间的关系,能够理解医患对话、抽取病历信息。这类数据是类似“患者咳嗽三天,咳黄痰”这样的句子集合。
- 卫生统计数据:面向人阅读的报表,例如“2023年全国肺炎发病率为X%”“某三甲医院月门诊量Y人次”。这些是统计结果,适合用于画图表、做分析,但无法用于训练模型识别“什么是咳嗽”。
需要注意:统计年鉴不适合用于训练NER(命名实体识别),方向用错会浪费大量时间。
中文医学文本的几个核心来源
如果目标是中文医疗NLP,下面几个入口基本是绕不开的,比自行检索效率更高。
1. CBLUE(天池平台)—— 中文医疗NLP基准评测
链接:https://tianchi.aliyun.com/dataset/95414
这是阿里云天池上由中文信息学会发布的基准评测,可视为事实上的行业标准,涵盖实体识别、关系抽取、文本分类、医学问答等8个子任务。如果不确定从何入手,可以从这里开始。下载需要在天池注册账号,流程简单。
2. CMeEE(天池平台)—— 入门级NER数据集
链接:https://tianchi.aliyun.com/dataset/144495
如果希望先让模型学会“识别”疾病、药物、身体部位等实体,这个数据集较为合适。它将疾病、临床表现、药物等9类实体标注清晰,同样在天池下载。
3. 医患对话(Hugging Face)
链接:https://huggingface.co/datasets/UCSD26/medical_dialog
如果要做问答模型或对话系统,这个数据集为纯中文的医患对话,可直接使用,无需签协议,对入门较友好。使用datasets库即可加载到代码中。
先查这些汇总目录
医疗NLP的来源较为分散,已有人将相关资源系统整理。以下几个GitHub仓库相当于一份资源索引。
- GanjinZero/awesome_Chinese_medical_NLP:https://github.com/GanjinZero/awesome_Chinese_medical_NLP
- FreedomIntelligence/Medical_NLP:https://github.com/FreedomIntelligence/Medical_NLP
需要提醒的是:这两个仓库是资源索引,而非数据本身。 其中列出的链接中,部分需要申请,部分可能已失效。你需要逐个打开核实,不能默认其中任意一个都可直接下载。
只能找到英文、或中文数据无法获取时
国内不少真实病历数据管理较严,需要资质审核、签署协议,无法随意下载。如果暂时无法获取,可以先使用下面这些没有门槛的英文数据集进行练习:
- MeDAL(医学缩写消歧数据集):https://github.com/McGill-NLP/medal
英文,但体量较大,免费下载,适合先做预训练,帮助模型熟悉医学语言的表达方式。
- MultiCaRe(多模态病例报告):介绍页在 https://pmc.ncbi.nlm.nih.gov/articles/PMC10792687/,数据托管在Zenodo。由7万多篇开放获取的病例报告提炼而成,包含近10万个病例,免费。
真正的难点:能否获取
医疗NLP数据的主要难点通常不在于“有没有”,而在于“能否获取”。有的可直接下载,有的需要注册,有的需签署保密协议,有的仅对医院开放。逐个尝试、确认每个数据集的准入门槛,往往需要花费较多时间。
如果不希望把精力耗在零散的试错上,想直接了解“哪个数据可用、哪个无法获取”,可以了解数聚天成 DeepSData。我们提供“数据可得性深度检索”服务:你提出需求,我们在天池、GitHub、PhysioNet、卫健委等分散的来源中代为检索,并如实反馈结果——哪个可以直接下载,哪个需要相应资质或签署协议才能获取,哪个实际上难以拿到,从而帮你节省逐一核实的时间。是否采用由你自行决定,这里提供的是一条可选的检索途径。
本文仅作公开来源整理和可得性参考,不构成医疗、法律、投资、商业决策或合规意见;正式使用前请以官方页面、授权条款和专业意见为准。
说明:本文为公开资料整理,仅供参考;平台政策、价格、下载方式与链接随时可能变化,本文不保证持续更新,请以各官方页面最新信息为准。
参考来源
- https://tianchi.aliyun.com/dataset/95414
- https://tianchi.aliyun.com/dataset/144495
- https://github.com/GanjinZero/awesome_Chinese_medical_NLP
- https://github.com/FreedomIntelligence/Medical_NLP
- https://github.com/zonghui0228/BioMedical-NLP-corpus
- https://huggingface.co/datasets/UCSD26/medical_dialog
- https://aistudio.baidu.com/datasetoverview
- https://www.kaggle.com/datasets/jpmiller/layoutlm
- https://physionet.org/
- https://www.physionet.org/content/mimic-iv-note/view-license/2.2/
- https://n2c2.dbmi.hms.harvard.edu/data-sets
- https://www.i2b2.org/NLP/DataSets/
- https://www.who.int/data/gho
- https://data.worldbank.org/topic/health
- https://www.nhc.gov.cn/mohwsbwstjxxzx/tjzxtjsj/tjsj_list.shtml
- https://github.com/McGill-NLP/medal
- https://pmc.ncbi.nlm.nih.gov/articles/PMC10792687/
