机器学习与语料免费访问
关键信息
内容与字段
该数据集包含5个文件:data_pubmed_all(全部文章)、data_pubmed(过滤后文章)、data_pubmed_train、data_pubmed_val、data_pubmed_test(按期刊随机60/20/20划分)。每个文章记录包含以下字段:
- pubmed_id——PubMed唯一标识符
- title——文章标题
- keywords——关键词
- journal——期刊名称
- abstract——摘要
- conclusions——结论
- methods——方法
- results——结果
- copyrights——版权信息
- doi——数字对象标识符
- publication_date——出版日期
- authors——作者
适用研究
适用于期刊推荐系统、学术文献分类、文本挖掘等自然语言处理与信息检索研究。
本卡由来源页信息起草,机构/覆盖/时间/规模/字段与许可以官方为准(待人工核验)。
关键词
自行获取的难点
获取结构化的PubMed文章数据用于期刊推荐模型训练时,常需处理字段不全或划分不明确的问题。
