论文部分内容阅读
摘 要: 本文通过对高校招生现状进行了总结分析,通过分析发现其中存在的问题,对数据挖掘技术进行了阐述,并将数据挖掘技术引进招生数据分析工作,旨在通过对招生数据的分析发现隐含的信息,据此优化招生工作。
关键词: 数据挖掘 高校招生 数据分析
一、高校招生现状分析
近年来,我国高校招生形势发生了巨大的变化,造成这种状况的原因很多,归纳起来有以下几个方面。一是随着国家教育政策的改革、高校扩招扩建及一些专科院校评估升级为本科院校等原因,导致高校本科招生总数逐年增加,但是生源数量有限,甚至呈逐年减少状况,因此如何在保证生源质量的前提下完成招生任务,是当前招生工作者面临的重要问题;二是国外教育机构逐渐增多,学生有更多的机会选择出国留学,因此,高校的生源危机日渐严重,招生形势日趋紧张。在这种情况下,高校如何通过创新的招生策略、准确的生源信息争取足够的、高质量的生源,是搞好招生工作的重中之重,也是关系到学校发展甚至生死存亡的关键。
除此之外,信息时代的到来,给高校的招生工作带来了新的契机,各大高校分别用网站、微信平台等进行宣传,并研发了各自的招生信息管理系统,建立了招生信息数据库,用来存储并处理历年的招生数据,这些处理只是简单地对数据的归纳整理、存储和读取,并未进行深层的数据分析和信息提取,但是在这些数据中可能会隐含一些潜在的并且非常有价值的信息,这些信息将对今后的招生工作产生一定的指导作用,却很少有人涉及。
二、数据挖掘技术
1.数据挖掘的概念
数据挖掘(data mining)是从大量的、不完全的、有噪声的、模糊的、随机的数据中提取隐含在其中的、人们事先不知道的、但又是潜在有用的信息和知识的过程[1]。一般认为,广义的数据挖掘又称为数据库中的知识发现(KDD),是指面对海量的数据,这些数据是冗余的、残缺不齐的、有噪声的、具有不确定性的数据集中,发现其中蕴含的那些是先未知的、可信赖的和有用的那些规律和知识的过程。狭义的数据挖掘仅仅是指从特定的数据集中提炼知识的过程。
2.数据挖掘应用
数据挖掘应用研究是指开发各种数据挖掘系统和工具,并在各个行业中应用[2]。目前的典型应用领域包括市场分析和预测、工业生产、金融、科学研究、Web数据挖掘、工程诊断等各个领域,如分析地壳的构造活动、网页内容自动分类和聚类等。
数据挖掘技术的研究逐渐深入,其应用非常广泛,凡是有具备数据分析潜质的数据库都可以用相关数据挖掘工具进行有目的的数据分析。近年来,有一些高校招生开始运用数据挖掘技术分析本校的生源状况,不断调整本校的招生数、招生策略等,从而在现在的生源大战中占得一席之地,但还未形成一套成熟的系统和方法。
三、数据挖掘技术在高校招生工作中的应用
1.数据库的建立
在进行数据处理之前,首先应建立数据库,规范标准的数据库是数据分析处理的前提。在这里以每一位学生作为一条数据,我们将历年的招生信息作如下处理:
(1)考生ID。这是标志每位学生的关键字,可以直接使用学生的考生号。
(2)考生姓名。用于核对、补全考生信息。
(3)考生性别。对于某些专业或者地区,性别可能会成为影响考生志愿的一个因素。
(4)考生籍贯。在这里,我们按照地理位置,以天津为中心,将天津作为A区向外辐射;北京、河北、山东、江苏作为B区;东北三省及陕西、山西、内蒙古、河南、江苏、安徽、湖北、上海、江西、浙江等省份作为C区,其余地区为D区。
(5)录取专业。考生录取的专业可能会和考生生源地及是否报到有关系;
(6)考生成绩。我们以当地当前批次的提档线为标准,每超过10分为一档,将考生划分为五挡,分别是:0-10分为E档,11-20分为D档,21-30分为C档,31-40分为B档,40分以上的考生均为A档。
(7)是否报到。0为未报到考生,1为报到考生。
2.数据的预处理
因为数据是由手工录入的,所以有些数据可能会出现一些错误,比如说值丢失、异常、冗余等,因此我们首先要对数据进行清理工作。比如ID只能是n位数字格式的字符串,成绩则限定在学校最低录取分数线和最高分之间,并且经过处理之后只能是字符“A”、“B”、“C”、“D”、“E”,籍贯同理,专业则对应成学校的专业代码,是否报道同样以0和1作为标志。对数据进行预处理后,数据库中的数据则变成统一的、精确的数据,可以进行下一步分析和处理。
3.确定数据挖掘模型
我们采用贝叶斯算法进行数据挖掘处理。贝叶斯是一种分类统计方法,用于预测类成员关系的可能性,比如判断某一样本属于某一特定类的概率,它分为朴素贝叶斯分类和贝叶斯网络分类两种[3]。目前,这种算法已经表现出非常高的准确率。本文采用的是朴素贝叶斯算法。贝叶斯分类是基于贝叶斯定理进行分类的,主要判断给出的样本属于某一类的概率,假设X是类标号未知的数据样本,H为某种假定,如数据样本X属于一个特定的类别C。分类问题就是决定P(HIX),即在获得数据样本X时假设成立的概率[4]。我们用2011-2013年天津师范大学的招生数据作为训练集样本进行训练,预测某一条件的考生录取我校某专业报道的概率,假如预测的结果为是,说明这类条件的考生更有可能报考并进入我校就读,反之,则说明此类考生报考我校的可能性很小,或者即使录取报道的可能性也很小,以此指导我校的招生计划编制和招生录取工作。
4.结果分析
经过数据的分析和处理,我们可以得出以下结论:
(1)就考生籍贯与报到率之间的关系而言,A地区的考生报到率最高,原因可能在于本地的院校对于吸收本地生源还是存在很大优势的,因此我们在进行计划编制的时候应该适当地向本地倾斜,并加大在本地区的宣传力度,包括招生宣传和日常的学生工作及大学生实习就业等;B区次之,包括山东、河北等地区的生源,这部分地区由于距离天津近,且考生数量多而当地院校数量有限,对周边院校具有更高的倾向性,因此我们可以对这些地区加大宣传力度,增加计划数量等,以保证生源的稳定;而C类和D类地区的考生报到率就相对较低,可能的原因有距离远,有些考生可能不愿意到距离很远的院校就读,一些气候、生活习惯等原因也会成为影响这些考生报考志愿的原因之一。除此之外,地区的经济结构也是影响考生志愿的一大因素,比如南方一些地区主要对于经济贸易类的专业更感兴趣一些,而我们主要专业集中在哲学、教育学等领域,对这类生源的吸引力相对小一些,因此生源一直不理想,报到率相对较低。 (2)就考生性别、专业与报到率之间的关系而言,某些专业对于性别的倾向性特别高,比如说学前教育专业,男生第一志愿的填报率本省就非常低,即便是被录取了,此专业的男生报到率也非常低。因此,我们在招生志愿不满需要进行调剂的时候,要根据这一结果制定相应的原则进行规避,尽量不对男考生调剂此专业,否则会造成指标的浪费,影响招生结果。除此之外,我们应与相应学院进行沟通,加强这类专业的宣传,尽量调整此类专业的性别分配不均衡状态。
(3)就考生成绩与地区的相关性而言,B类地区的考生总体成绩较高,集中在A,B档,可能是由于这类地区计划少,生源多,相对竞争较大,因此我们应该适当调整政策,向这类地区倾斜。
(4)就专业与报到率而言,学校存在某些专业报到率低而另一些专业的报到率高等现象。因此,我们一方面应该适当调整各专业的计划数,另一方面应该与相关学院一起商讨应对措施,提升专业影响力。
四、结语
随着政策的变化和信息技术的发展,招生方式日渐多元化、规范化、公平化、合理化,而招生形势日渐严峻,高校该如何在这种日趋紧张的形势下脱颖而出,争取足量的、优质的生源是高校生存和发展的关键所在,本文以天津师范大学近三年的招生数据为基础,建立标准数据库,并对数据进行分析处理,找出数据属性之间的关系,并从中总结出相应的隐含信息,寻找对我校兴趣最高或者左右可能报考我校的考生特征及优质考生的兴趣点所在,并以此指导招生工作进行招生决策和招生策略的调整,科学地、合理地、高效地开展招生宣传、计划编制、招生录取和专业调剂等工作,对于高校招生工作的有效开展及保证高校办学质量有重要的实践意义。
参考文献:
[1]陈文文.数据挖掘在高校规模分析决策中的应用研究[D].沈阳理工大学硕士论文,2011-12-01.
[2]饶莹心.数据挖掘技术在招生决策系统中的应用[D].华东理工大学硕士论文,2013-4-15.
[3]沈伟.基于数据挖掘技术的高职院校招生决策仓库设计与实现[J].网络安全技术与应用,2015,3.
[4]蒋莹莹.浅谈数据挖掘技术在电大开放教育招生中的应用[J].现代教育,2011,9.
本论文受2014年天津师范大学教育科学研究基金项目资助(项目号:52WT1404)
本论文受天津广播电视大学2013年度校级课题项目资助(项目号:13XY1032)
关键词: 数据挖掘 高校招生 数据分析
一、高校招生现状分析
近年来,我国高校招生形势发生了巨大的变化,造成这种状况的原因很多,归纳起来有以下几个方面。一是随着国家教育政策的改革、高校扩招扩建及一些专科院校评估升级为本科院校等原因,导致高校本科招生总数逐年增加,但是生源数量有限,甚至呈逐年减少状况,因此如何在保证生源质量的前提下完成招生任务,是当前招生工作者面临的重要问题;二是国外教育机构逐渐增多,学生有更多的机会选择出国留学,因此,高校的生源危机日渐严重,招生形势日趋紧张。在这种情况下,高校如何通过创新的招生策略、准确的生源信息争取足够的、高质量的生源,是搞好招生工作的重中之重,也是关系到学校发展甚至生死存亡的关键。
除此之外,信息时代的到来,给高校的招生工作带来了新的契机,各大高校分别用网站、微信平台等进行宣传,并研发了各自的招生信息管理系统,建立了招生信息数据库,用来存储并处理历年的招生数据,这些处理只是简单地对数据的归纳整理、存储和读取,并未进行深层的数据分析和信息提取,但是在这些数据中可能会隐含一些潜在的并且非常有价值的信息,这些信息将对今后的招生工作产生一定的指导作用,却很少有人涉及。
二、数据挖掘技术
1.数据挖掘的概念
数据挖掘(data mining)是从大量的、不完全的、有噪声的、模糊的、随机的数据中提取隐含在其中的、人们事先不知道的、但又是潜在有用的信息和知识的过程[1]。一般认为,广义的数据挖掘又称为数据库中的知识发现(KDD),是指面对海量的数据,这些数据是冗余的、残缺不齐的、有噪声的、具有不确定性的数据集中,发现其中蕴含的那些是先未知的、可信赖的和有用的那些规律和知识的过程。狭义的数据挖掘仅仅是指从特定的数据集中提炼知识的过程。
2.数据挖掘应用
数据挖掘应用研究是指开发各种数据挖掘系统和工具,并在各个行业中应用[2]。目前的典型应用领域包括市场分析和预测、工业生产、金融、科学研究、Web数据挖掘、工程诊断等各个领域,如分析地壳的构造活动、网页内容自动分类和聚类等。
数据挖掘技术的研究逐渐深入,其应用非常广泛,凡是有具备数据分析潜质的数据库都可以用相关数据挖掘工具进行有目的的数据分析。近年来,有一些高校招生开始运用数据挖掘技术分析本校的生源状况,不断调整本校的招生数、招生策略等,从而在现在的生源大战中占得一席之地,但还未形成一套成熟的系统和方法。
三、数据挖掘技术在高校招生工作中的应用
1.数据库的建立
在进行数据处理之前,首先应建立数据库,规范标准的数据库是数据分析处理的前提。在这里以每一位学生作为一条数据,我们将历年的招生信息作如下处理:
(1)考生ID。这是标志每位学生的关键字,可以直接使用学生的考生号。
(2)考生姓名。用于核对、补全考生信息。
(3)考生性别。对于某些专业或者地区,性别可能会成为影响考生志愿的一个因素。
(4)考生籍贯。在这里,我们按照地理位置,以天津为中心,将天津作为A区向外辐射;北京、河北、山东、江苏作为B区;东北三省及陕西、山西、内蒙古、河南、江苏、安徽、湖北、上海、江西、浙江等省份作为C区,其余地区为D区。
(5)录取专业。考生录取的专业可能会和考生生源地及是否报到有关系;
(6)考生成绩。我们以当地当前批次的提档线为标准,每超过10分为一档,将考生划分为五挡,分别是:0-10分为E档,11-20分为D档,21-30分为C档,31-40分为B档,40分以上的考生均为A档。
(7)是否报到。0为未报到考生,1为报到考生。
2.数据的预处理
因为数据是由手工录入的,所以有些数据可能会出现一些错误,比如说值丢失、异常、冗余等,因此我们首先要对数据进行清理工作。比如ID只能是n位数字格式的字符串,成绩则限定在学校最低录取分数线和最高分之间,并且经过处理之后只能是字符“A”、“B”、“C”、“D”、“E”,籍贯同理,专业则对应成学校的专业代码,是否报道同样以0和1作为标志。对数据进行预处理后,数据库中的数据则变成统一的、精确的数据,可以进行下一步分析和处理。
3.确定数据挖掘模型
我们采用贝叶斯算法进行数据挖掘处理。贝叶斯是一种分类统计方法,用于预测类成员关系的可能性,比如判断某一样本属于某一特定类的概率,它分为朴素贝叶斯分类和贝叶斯网络分类两种[3]。目前,这种算法已经表现出非常高的准确率。本文采用的是朴素贝叶斯算法。贝叶斯分类是基于贝叶斯定理进行分类的,主要判断给出的样本属于某一类的概率,假设X是类标号未知的数据样本,H为某种假定,如数据样本X属于一个特定的类别C。分类问题就是决定P(HIX),即在获得数据样本X时假设成立的概率[4]。我们用2011-2013年天津师范大学的招生数据作为训练集样本进行训练,预测某一条件的考生录取我校某专业报道的概率,假如预测的结果为是,说明这类条件的考生更有可能报考并进入我校就读,反之,则说明此类考生报考我校的可能性很小,或者即使录取报道的可能性也很小,以此指导我校的招生计划编制和招生录取工作。
4.结果分析
经过数据的分析和处理,我们可以得出以下结论:
(1)就考生籍贯与报到率之间的关系而言,A地区的考生报到率最高,原因可能在于本地的院校对于吸收本地生源还是存在很大优势的,因此我们在进行计划编制的时候应该适当地向本地倾斜,并加大在本地区的宣传力度,包括招生宣传和日常的学生工作及大学生实习就业等;B区次之,包括山东、河北等地区的生源,这部分地区由于距离天津近,且考生数量多而当地院校数量有限,对周边院校具有更高的倾向性,因此我们可以对这些地区加大宣传力度,增加计划数量等,以保证生源的稳定;而C类和D类地区的考生报到率就相对较低,可能的原因有距离远,有些考生可能不愿意到距离很远的院校就读,一些气候、生活习惯等原因也会成为影响这些考生报考志愿的原因之一。除此之外,地区的经济结构也是影响考生志愿的一大因素,比如南方一些地区主要对于经济贸易类的专业更感兴趣一些,而我们主要专业集中在哲学、教育学等领域,对这类生源的吸引力相对小一些,因此生源一直不理想,报到率相对较低。 (2)就考生性别、专业与报到率之间的关系而言,某些专业对于性别的倾向性特别高,比如说学前教育专业,男生第一志愿的填报率本省就非常低,即便是被录取了,此专业的男生报到率也非常低。因此,我们在招生志愿不满需要进行调剂的时候,要根据这一结果制定相应的原则进行规避,尽量不对男考生调剂此专业,否则会造成指标的浪费,影响招生结果。除此之外,我们应与相应学院进行沟通,加强这类专业的宣传,尽量调整此类专业的性别分配不均衡状态。
(3)就考生成绩与地区的相关性而言,B类地区的考生总体成绩较高,集中在A,B档,可能是由于这类地区计划少,生源多,相对竞争较大,因此我们应该适当调整政策,向这类地区倾斜。
(4)就专业与报到率而言,学校存在某些专业报到率低而另一些专业的报到率高等现象。因此,我们一方面应该适当调整各专业的计划数,另一方面应该与相关学院一起商讨应对措施,提升专业影响力。
四、结语
随着政策的变化和信息技术的发展,招生方式日渐多元化、规范化、公平化、合理化,而招生形势日渐严峻,高校该如何在这种日趋紧张的形势下脱颖而出,争取足量的、优质的生源是高校生存和发展的关键所在,本文以天津师范大学近三年的招生数据为基础,建立标准数据库,并对数据进行分析处理,找出数据属性之间的关系,并从中总结出相应的隐含信息,寻找对我校兴趣最高或者左右可能报考我校的考生特征及优质考生的兴趣点所在,并以此指导招生工作进行招生决策和招生策略的调整,科学地、合理地、高效地开展招生宣传、计划编制、招生录取和专业调剂等工作,对于高校招生工作的有效开展及保证高校办学质量有重要的实践意义。
参考文献:
[1]陈文文.数据挖掘在高校规模分析决策中的应用研究[D].沈阳理工大学硕士论文,2011-12-01.
[2]饶莹心.数据挖掘技术在招生决策系统中的应用[D].华东理工大学硕士论文,2013-4-15.
[3]沈伟.基于数据挖掘技术的高职院校招生决策仓库设计与实现[J].网络安全技术与应用,2015,3.
[4]蒋莹莹.浅谈数据挖掘技术在电大开放教育招生中的应用[J].现代教育,2011,9.
本论文受2014年天津师范大学教育科学研究基金项目资助(项目号:52WT1404)
本论文受天津广播电视大学2013年度校级课题项目资助(项目号:13XY1032)