【摘 要】
:
主观性试题因评分效率低、评分误差大历来都是测量界的难题。随着计算机技术以及测量技术的迅猛发展,主观性试题的计算机自动测评由理想变成了现实。国外,以E-rater为代表的作文自动评分系统已经被广泛运用于GRE、GMAT以及托福训练测试的作文评分中,Pearson公司也致力于将作文自动评分技术应用于美国各州的共同核心标准测试(Common Core State Standards)1中;国内,科大讯飞
论文部分内容阅读
主观性试题因评分效率低、评分误差大历来都是测量界的难题。随着计算机技术以及测量技术的迅猛发展,主观性试题的计算机自动测评由理想变成了现实。国外,以E-rater为代表的作文自动评分系统已经被广泛运用于GRE、GMAT以及托福训练测试的作文评分中,Pearson公司也致力于将作文自动评分技术应用于美国各州的共同核心标准测试(Common Core State Standards)1中;国内,科大讯飞公司在模型建构、特征值抽取等方面取得了突破,利用语音识别等技术,开发了多语种的口语测评系统,广泛应用于普通话水平测试(PSC)、中考英语测试以及中国少数民族汉语水平等级考试(MHK)中。近期,该公司的作文自动评分系统也取得了突破性进展,显示了良好的应用前景。
其他文献
密集型追踪数据(Intensive Longitudinal Data,ILD)是对一个或多个随时间变化的变量进行密集、大量地重复测量的追踪数据(Wall&Schafer, 2006).相比于测量次数非常有限的传统追踪数据,密集型追踪数据可以提供更丰富的信息.但密集型追踪数据的复杂性也给数据分析带来了挑战.传统的追踪数据分析方法(如潜变量增长曲线模型等)往往假设变量变化符合某个特定形状,并假设协变
目前越来越多的研究关注到计算机化多阶段自适应测试(Multistage adaptive testing MST),计算机化多阶段自适应测验是传统纸笔测验和计算机化自适应测验(Computerized adaptive test,CAT)的妥协物,它是以项目题组(testlet)为计分单元,并被测验开发者自适应管理的一种测验形式.(Hendrickson,2007).Zheng &Chang(20
多维计算机化自适应测验(MCAT)将多维项目反应理论(MIRT)与计算机化自适应测验(CAT)相结合,不仅能实现因人实测,极大地提高测验效率,还能同时估计被试在测验每个维度上的能力水平,诊断个体的认知优势与不足,为个体的因材施教及有针对性地开展补救提供服务。选题策略是MCAT的关键,信息量常被用来构造MCAT的选题策略,根据所依据的信息量不同,本文将MCAT中选题策略分为基于Fisher信息量(比
成对比较(paired-comparison)的方法在测查偏好、态度和价值观等方面起着非常重要的作用,瑟斯顿模型是主要的成对比较模型。为了探究个体协变量对瑟斯顿模型的影响,通过两个模拟研究,考察存在个体协变量时,协变量对各选项的影响系数相同和协变量对各选项的影响系数不同时,使用SEM分析方法和两步法两种方法对模拟数据的参数估计结果的差异,以及不同的样本量、成对比较的项目个数对估计结果的影响。
计算机化多阶段测试(Multi-stage Testing,MST)是一种正在兴起的测试方式。其核心思想是将一次测试拆分为两个或两个以上相互关联的阶段,在第二及其之后的各个阶段,考生所答试题取决于他在此前阶段的作答表现。通常,主考者事先在第二及其之后的各个阶段设置了难、中、易或更多难度级别的若干题组。当考生进入第二及其之后的阶段时,他所要求作答的题组的难度级别必须根据他在前一阶段的作答表现来定。若
解答數學問題往往不侷限於一種解海學生因為不同的學習發展層次或是數學能力的高低差異,就可能會使用不同的解題策略解答相同的試題,不同的解題策略意味著應用不同的概念來解題,當概念的學習發生錯誤時,便會衍生不同的錯誤類型。修補理論(Repair Theory;Brown,&VanLehn,1980)說明學生解題時產生錯誤的原因,主要是學習者使用不完全的解題算則遇到僵局,於是找出自己較能接受的法則來解決,這