机器学习与语料获取方式:请查看来源页面
关键信息
内容与字段
该数据集包含多种语言的口语录音及其对应的文本转录,用于训练语音识别系统。具体字段包括音频文件、文本标注等,但元数据未提供详细字段列表。
适用研究
适用于多语言语音识别、声学模型训练、语音文本对齐等研究。
信息来自公开来源,具体内容和使用条件请以来源页面为准。
关键词
自行获取的难点
该数据集通过 Zenodo 分发,下载需注意文件格式与清洗成本,且版本更新频繁,需确认使用版本。
该数据集包含多种语言的口语录音及其对应的文本转录,用于训练语音识别系统。具体字段包括音频文件、文本标注等,但元数据未提供详细字段列表。
适用于多语言语音识别、声学模型训练、语音文本对齐等研究。
信息来自公开来源,具体内容和使用条件请以来源页面为准。
该数据集通过 Zenodo 分发,下载需注意文件格式与清洗成本,且版本更新频繁,需确认使用版本。
Mandarine Academy Recommender System (MARS) Dataset,来自哈佛Dataverse…
由LDC和NIST开发的2021年说话人识别评测开发与测试集,包含约447小时粤语、普通话和英语电话会话语音、视频音频及图像数据,附答案键、注册和试验文件。
ORIN Lyrics数据集包含862条尼日利亚歌曲歌词,涵盖约鲁巴语、英语、尼日利亚皮钦语及多语言组合,附有艺术家、标题、专辑、年份、流派等元数据,专为自然语言处理研究设计。
该语料库包含海因里希·冯·克莱斯特的八部中短篇小说、两篇散文及政治写作等散文作品,文本源自Project Gutenberg,使用LancsBox X进行词频和聚类分析。