机器学习与语料免费访问
关键信息
内容与字段
该数据集包含脚本、输入和输出数据,用于复现ICPP 2023论文中的结果。输入数据为模拟的X射线自由电子激光(XFEL)蛋白质衍射图像,分为低、中、高三种束强度,每种强度包含63,508张训练图像和15,876张测试图像(80/20分割)。输出数据包含使用A4NN工作流在不同GPU分布上生成的神经网络模型和元数据,每个实验包含100个NN模型,每个模型最多训练25个epoch,总计约72,900个模型相关文件。
- README.txt——说明文件,包含数据集使用说明
- 训练图像——模拟XFEL衍射图像,用于训练神经网络
- 测试图像——模拟XFEL衍射图像,用于测试神经网络
- NN模型——神经网络模型文件,每个实验100个
- 元数据——训练历史等元数据文件
适用研究
该数据集适用于蛋白质分类、神经网络架构搜索、可重复计算工作流等方向的研究。
本卡由来源页信息起草,机构/覆盖/时间/规模/字段与许可以官方为准(待人工核验)。
关键词
自行获取的难点
获取蛋白质衍射数据及对应神经网络模型时,常面临数据格式不统一、模型文件数量庞大、元数据缺失等问题。
