摘要:语言能力语音数据集,是一个面向英语语言能力评估与语音分析研究的数据集,通过英语语音记录以及说话者的人口统计、语言背景、语音表现和交流能力等特征,为自动化语言能力等级评估提供数据支持。
数据集概述
该数据集共包含 15,000 条语音能力评估记录,每条记录对应一名说话者,并包含年龄组、性别、母语、地区、英语接触程度和教育水平等信息,同时记录语速、平均音高、语音能量、发音、流利度、节奏、词汇、语法、清晰度、连贯性以及交流信心等多维度指标。数据最终以 5个语言能力等级作为目标类别,可用于研究英语口语能力的自动化、多类别评估。
数据结构与关键特征
数据集共包含 15,000条记录、32个字段,主要由说话者基本信息、语言背景、声学特征、语音表达能力、语言能力指标和目标标签构成。其中 Speaker_ID 用于标识说话者,Age_Group、Gender、Native_Language、Region、Education_Level 等描述说话者背景;Speech_Duration_sec、Speaking_Rate_WPM、Average_Pitch_Hz、Pitch_Variation、Speech_Energy 等反映语音声学特征;Pronunciation_Score、Fluency_Score、Vocabulary_Score、Grammar_Score、Lexical_Richness、Coherence_Score 等反映语言能力;Pause_Duration_sec、Response_Delay_sec、Hesitation_Count、Filler_Word_Frequency 等用于刻画语音流畅性和交流行为。Language_Proficiency_Level 为最终目标变量。
应用价值与研究方向
该数据集适用于自动语言能力评估、英语口语评分、语音质量分析、发音评价和智能语言学习系统等研究。研究人员可以利用机器学习和深度学习方法建立五分类语言能力预测模型,也可以进一步研究语音声学特征与语言能力之间的关联。结合随机森林、XGBoost、SVM、神经网络以及多模态模型,还可以构建智能口语测评、个性化英语学习、计算机辅助语言学习(CALL)、发音纠错、语言教育数据分析和自适应学习系统,具有较好的教育人工智能应用价值。
数据集来源
由张家梁(Bob)整理并于2026年在7zcode平台公开发布。
数据集信息
免责声明与引用
数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。
作者信息
作者:Bob (张家梁)
项目编号:Datasets-613
文件大小:865M
原创声明:本数据集为整理作品