数聚天成 DeepSData
公开数据资料 · 机器学习与语料

Common Crawl 网页语料 Common Crawl

覆盖全球公开网页、按月持续更新的 PB 级标准化 Web 归档语料,是大模型预训练与大规模文本研究的基础语料源。

获取免费访问
许可许可原文仍在核对
格式WARC
发布方Common Crawl Foundation

← 返回公开数据集资料库

机器学习与语料免费访问

关键信息

机构Common Crawl Foundation
覆盖全球公开网页(逾 3000 亿页)
时间2008 起,月度更新
规模单月约 21 亿页 / PB 级累计

主要变量 / 测量指标

网页正文元数据超链接关系

内容与字段

格式含义
WARC原始 HTTP 请求/响应(含 HTML)
WAT提取的元数据(链接、标题等 JSON)
WET仅抽取的纯文本正文

另含 URL 索引(CDXJ/列式)、超链接图谱。主要字段:URL、抓取时间戳、HTTP 状态、MIME 类型、内容与纯文本。

适用研究

大规模语料研究、自然语言处理与大模型预训练。

版本CC-MAIN-2026-21 · 格式WARC/WAT/WET(gzip)+ 列式索引

网页内容版权归原站;用户需自行做合规清洗与过滤,遵守来源许可与中国法律法规;元数据 2026-06 核验。

关键词

网页语料大模型预训练WARC自然语言处理Common Crawl

获取与许可

许可:许可原文仍在核对 | 免费访问 | 格式:WARC

自行获取的难点

自行从全网抓取、去重、对齐格式并维护跨月份版本口径,往往耗费大量算力与工程时间且难以复现。我们已梳理好格式、字段与索引脉络,直接取用可研究的语料。

相关数据集

同领域 · 机器学习与语料

需要确认该数据是否满足你的任务?

请向小聚说明用途与必须满足的条件。先按这些条件查找和比对;需要继续核对文件、字段或许可,再交给团队处理。

本站资料可免费查阅;第三方数据能否下载、商用或再分发,以原发布方许可为准。

帮我取数