医疗NLP数据集去哪找下载:CBLUE、CMeEE 等中文医疗语料来源

本文把中文医疗NLP语料的常见来源和准入门槛梳理清楚,帮助你直接定位到对自己有用的数据。

先分清楚你要的是“训练语料”还是“统计报表”

这是医疗NLP选数据时最常见的误区。

通常说的“医疗数据”分为两类,用途差别很大:

  1. 训练文本语料:用于训练模型,让它学会识别“咳嗽”“肺炎”“阿莫西林”这些词之间的关系,能够理解医患对话、抽取病历信息。这类数据是类似“患者咳嗽三天,咳黄痰”这样的句子集合。
  2. 卫生统计数据:面向人阅读的报表,例如“2023年全国肺炎发病率为X%”“某三甲医院月门诊量Y人次”。这些是统计结果,适合用于画图表、做分析,但无法用于训练模型识别“什么是咳嗽”。

需要注意:统计年鉴不适合用于训练NER(命名实体识别),方向用错会浪费大量时间。

中文医学文本的几个核心来源

如果目标是中文医疗NLP,下面几个入口基本是绕不开的,比自行检索效率更高。

1. CBLUE(天池平台)—— 中文医疗NLP基准评测

链接:https://tianchi.aliyun.com/dataset/95414

这是阿里云天池上由中文信息学会发布的基准评测,可视为事实上的行业标准,涵盖实体识别、关系抽取、文本分类、医学问答等8个子任务。如果不确定从何入手,可以从这里开始。下载需要在天池注册账号,流程简单。

2. CMeEE(天池平台)—— 入门级NER数据集

链接:https://tianchi.aliyun.com/dataset/144495

如果希望先让模型学会“识别”疾病、药物、身体部位等实体,这个数据集较为合适。它将疾病、临床表现、药物等9类实体标注清晰,同样在天池下载。

3. 医患对话(Hugging Face)

链接:https://huggingface.co/datasets/UCSD26/medical_dialog

如果要做问答模型或对话系统,这个数据集为纯中文的医患对话,可直接使用,无需签协议,对入门较友好。使用datasets库即可加载到代码中。

先查这些汇总目录

医疗NLP的来源较为分散,已有人将相关资源系统整理。以下几个GitHub仓库相当于一份资源索引。

需要提醒的是:这两个仓库是资源索引,而非数据本身。 其中列出的链接中,部分需要申请,部分可能已失效。你需要逐个打开核实,不能默认其中任意一个都可直接下载。

只能找到英文、或中文数据无法获取时

国内不少真实病历数据管理较严,需要资质审核、签署协议,无法随意下载。如果暂时无法获取,可以先使用下面这些没有门槛的英文数据集进行练习:

英文,但体量较大,免费下载,适合先做预训练,帮助模型熟悉医学语言的表达方式。

真正的难点:能否获取

医疗NLP数据的主要难点通常不在于“有没有”,而在于“能否获取”。有的可直接下载,有的需要注册,有的需签署保密协议,有的仅对医院开放。逐个尝试、确认每个数据集的准入门槛,往往需要花费较多时间。

如果不希望把精力耗在零散的试错上,想直接了解“哪个数据可用、哪个无法获取”,可以了解数聚天成 DeepSData。我们提供“数据可得性深度检索”服务:你提出需求,我们在天池、GitHub、PhysioNet、卫健委等分散的来源中代为检索,并如实反馈结果——哪个可以直接下载,哪个需要相应资质或签署协议才能获取,哪个实际上难以拿到,从而帮你节省逐一核实的时间。是否采用由你自行决定,这里提供的是一条可选的检索途径。


本文仅作公开来源整理和可得性参考,不构成医疗、法律、投资、商业决策或合规意见;正式使用前请以官方页面、授权条款和专业意见为准。

说明:本文为公开资料整理,仅供参考;平台政策、价格、下载方式与链接随时可能变化,本文不保证持续更新,请以各官方页面最新信息为准。

找到相关数据后,还需要继续核验或整理?先查看相关说明卡;没有合适数据,或现成数据不能直接使用时,可以继续检索、来源核验、整理或定制。新用户注册可先体验标准检索评估。
提交数据需求 →