数聚天成 DeepSData
公开数据资料 · 机器学习与语料

OPUS 开放平行语料库 OPUS · Open Parallel Corpus

规模最大的开放多语平行语料集合,逾千种语言、上千组语言对,是机器翻译与多语 NLP 的基础库。

获取免费访问
许可许可原文仍在核对
发布方Helsinki-NLP / NLPL

← 返回公开数据集资料库

机器学习与语料免费访问

关键信息

机构赫尔辛基大学 Helsinki-NLP
覆盖约 1005 语言 · 1214 语料
规模约 1029 亿句对
时间各子语料滚动更新

主要变量 / 测量指标

句对齐双语文本语言对标识

内容与字段

双语/多语逐句对齐文本(bitext):源语言句、目标语言句、语言对标识、子语料来源标识、句对齐信息(XCES stand-off);部分经处理含分词、词形还原与词性标注。

适用研究

机器翻译、跨语言模型与多语 NLP。

格式XML+对齐 / TMX / Moses 纯文本 · 工具OpusTools / API

许可依各子语料各异,使用前须逐子语料核对;元数据 2026-06 核验。

关键词

平行语料机器翻译多语NLP句对齐parallel corpus

获取与许可

许可:许可原文仍在核对 | 免费访问

自行获取的难点

语料来源分散、版本与对齐口径各异、子语料格式与授权各不相同,逐一甄别整合往往耗时费力。我们已完成梳理与统一交付,按语言对即取即用。

相关数据集

同领域 · 机器学习与语料

需要确认该数据是否满足你的任务?

请向小聚说明用途与必须满足的条件。先按这些条件查找和比对;需要继续核对文件、字段或许可,再交给团队处理。

本站资料可免费查阅;第三方数据能否下载、商用或再分发,以原发布方许可为准。

帮我取数