数聚天成 DeepSData
结构化数据集说明卡 · 机器学习与语料

Common Voice 语料库 1 Common Voice Corpus 1

Mozilla Common Voice 多语言开源语音识别语料,包含多种语言的口语录音与文本对齐数据,是训练语音识别模型的刚需资源。

← 返回公开数据集说明库

机器学习与语料访问条件待核验

关键信息

获取https://zenodo.org/records/12588635
许可许可待核验
时间2024-06-29

内容与字段

该数据集包含多种语言的口语录音及其对应的文本转录,用于训练语音识别系统。具体字段包括音频文件、文本标注等,但元数据未提供详细字段列表。

适用研究

适用于多语言语音识别、声学模型训练、语音文本对齐等研究。

元数据以来源页为准(2026-07 工厂起草 · 待人工核验)。

关键词

语音识别多语言开源语料Common VoiceMozilla

获取与许可

许可:许可待核验 | 访问条件待核验

自行获取的难点

该数据集通过 Zenodo 分发,下载需注意文件格式与清洗成本,且版本更新频繁,需确认使用版本。

相关数据集

同领域 · 机器学习与语料

机器学习与语料免费访问

OpenAlex 学术图谱 OpenAlex

完全开放的全球学术元数据库,收录数亿篇论文及其作者、机构、期刊、引用与主题关联,CC0 免费,是文献计量与科研知识图谱的开放替代。…

这个数据集,要我们帮你取数与整理?

告诉我们研究必须满足的条件,先做可得性评估,再真实检索与整理;确实拿不到会直接说明,不绕弯子。

说明卡免费查阅;检索、整理与定制交付按实际需求提供,第三方数据使用权限以原始许可为准。

帮我取数