数聚天成 DeepSData
公开数据资料 · 机器学习与语料

A4NN工作流在蛋白质衍射数据上的架构描述、模型检查点与训练历史 Architecture Descriptions, Model Checkpoints, and Training Histories for A4NN Workflow on Protein Diffraction Data

该数据集包含ICPP 2023论文中A4NN工作流在蛋白质衍射数据上的脚本、输入与输出数据,包括模拟的XFEL衍射图像及神经网络模型。

获取免费访问
许可许可原文仍在核对
发布方Harvard Dataverse

← 返回公开数据集资料库

机器学习与语料免费访问

关键信息

机构Harvard Dataverse
覆盖模拟蛋白质衍射图像(低、中、高束强度)及神经网络模型
时间以官方为准
规模44个文件;约72,900个模型相关文件
许可许可原文仍在核对
获取Harvard Dataverse

内容与字段

该数据集包含脚本、输入和输出数据,用于复现ICPP 2023论文中的结果。输入数据为模拟的X射线自由电子激光(XFEL)蛋白质衍射图像,分为低、中、高三种束强度,每种强度包含63,508张训练图像和15,876张测试图像(80/20分割)。输出数据包含使用A4NN工作流在不同GPU分布上生成的神经网络模型和元数据,每个实验包含100个NN模型,每个模型最多训练25个epoch,总计约72,900个模型相关文件。

  • README.txt——说明文件,包含数据集使用说明
  • 训练图像——模拟XFEL衍射图像,用于训练神经网络
  • 测试图像——模拟XFEL衍射图像,用于测试神经网络
  • NN模型——神经网络模型文件,每个实验100个
  • 元数据——训练历史等元数据文件

适用研究

该数据集适用于蛋白质分类、神经网络架构搜索、可重复计算工作流等方向的研究。

信息来自公开来源,具体内容和使用条件请以来源页面为准。

关键词

蛋白质衍射神经网络架构搜索XFELA4NN可重复性图像分类

获取与许可

许可:许可原文仍在核对 | 免费访问

自行获取的难点

获取蛋白质衍射数据及对应神经网络模型时,常面临数据格式不统一、模型文件数量庞大、元数据缺失等问题。

相关数据集

同领域 · 机器学习与语料

想确认这个数据能不能满足你的任务?

告诉小聚你的用途和不能少的条件。先按这些条件查找和比对;需要继续核对文件、字段或许可,再交给团队处理。

本站资料可免费查阅;第三方数据能否下载、商用或再分发,以原发布方许可为准。

帮我取数