【摘 要】
:
多项选择题(multiple-choice item)是计算机自适应测验(computerized adaptive testing,CAT)中使用最广泛的题型之一。一道多项选择题通常包括一个正确项和若干个干扰项(distractor)。但在CAT的实际实施和结果分析中,通常只考虑被试是否答对,即把多项选择题当作简单的两点计分的题目处理。这样的处理方式忽略了被试在干扰项上的不同作答,可能造成部分信
【机 构】
:
天津师范大学教育科学学院 深圳讯飞智慧科技有限公司
论文部分内容阅读
多项选择题(multiple-choice item)是计算机自适应测验(computerized adaptive testing,CAT)中使用最广泛的题型之一。一道多项选择题通常包括一个正确项和若干个干扰项(distractor)。但在CAT的实际实施和结果分析中,通常只考虑被试是否答对,即把多项选择题当作简单的两点计分的题目处理。这样的处理方式忽略了被试在干扰项上的不同作答,可能造成部分信息的损失。本研究主要讨论在计算机自适应测验中,纳入干扰项信息以后,会对最终的被试评估产生怎样的影响。研究将以嵌套logit模型(nested logit model,NLM)作为CAT的基础模型,并且从两个方向展开。第一,当以NLM为基础实施CAT时,干扰项信息的纳入,是否能够提高被试估计的准确性。研究结果显示,在相同终止规则的情况下,NLM基础的CAT要比二参数模型(2parameter logistic model,2PLM)基础的CAT评估准确性更高。从信息量的角度来说,NLM的测验信息量要大于2PLM的测验信息量,特别是针对能力水平较低的被试。第二,当干扰项选择错误时,会对CAT的最终效果有怎么样的影响。研究结果证明,早期的干扰项误选会对CAT造成较大的影响。干扰项一方面增加更多的错误信息,造成CAT的评估准确性的下降。另一方面,正确选择的干扰项仍然会提供更多的信息,一定程度上矫正不良的影响。具体影响情况依赖于误选题量与总题量的比率。总体而言,本研说明,干扰项信息的纳入影响可能是双向的,正常作答情况下,干扰项信息可以提高被试的估计准确性;而当被试误选了干扰项时,也会提供更多的错误信息,从而影响CAT最终的评估效果。
其他文献
Q矩阵是进行认知诊断的基础,正确的Q矩阵是进行被试诊断分类的关键,Q矩阵的界定的复杂性限制了认知诊断在实际中的应用。现有Q矩阵估计和修正方法均是基于复杂的统计测量学知识,需要进行大量的运算。本研究受HCI(Hierarchy Consistency Index)指标的启发,开发ICC (Item Consistency Criterion)指标,提出一种基于得分矩阵的Q矩阵估计和修正方法,通过比较
认知诊断以微观认知角度对被试做出准确评估与反馈的优势在心理与教育测量领域中展现出巨大的发展潜力。但是,要利用这种优势就必须确保测验Q矩阵的合理性。以往研究构建测验Q矩阵主要依赖专家的经验,其缺点是专家的水平及意见统一与否会严重影响Q矩阵的正确性,而错误界定的Q矩阵会对模型参数估计和被试分类准确性带来严重影响。为克服该困难,国内外研究者相继开发出基于被试作答反应数据的Q矩阵估计方法,以数据驱动视角为
主观性试题因其具有的诸多优势常被用来测评考生的语言能力。复述是口语考试中的一种常见题型,它主要考查的是考生获取关键信息、语言表达和逻辑连贯等方面的能力。复述是MHK四级口语考试的第一种题型,主要用来考查少数民族大学毕业生的语言表达能力。目前,MHK四级复述题采用“2+1”的模式,已实现网上评阅,评分的质量得到了基本保障。但因复试题评阅的时间偏长,评分效率较低,加上评分员的疲劳效应等因素的影响,评分
以结构方程模型为代表的潜变量模型在心理学和社会科学各领域得到了广泛的应用。在传统的结构方程模型中,研究的样本通常假设来自同质性群体,然而这一假设在很多情况下并不成立。不同质群体的结构方程建模可以使用多组分析或多指标多因模型。不过这种处理的前提是存在明确的分组变量,只是更多时候,很难找到客观的外显分组变量,最常见的例子如心理疾病的分类诊断标准。在统计学上,为了处理潜在分组问题,研究者提出了多种统计模
评价测评工具结果的有效性,不能单从结构效度进行,还应评价该工具测得的分数与效标间是否具有某种实证关系,即效标关联效度;操作上,常通过目标结构与效标的相关系数进行评价。学界近年对共同方法变异的关注始于大量研究者发现不同心理变量间由于采用了相同的测量方法,其协方差中会包含共同方法造成的变异,得到有偏的相关系数,研究者可能得出不当乃至错误的结论。
主观性试题因其具有较高的效度而广泛用于口语测试当中。目前,口语测试已经实现了网上评阅,评分的效率和质量得到了明显提高。尽管如此,由于题型的自身局限,评分误差大等问题依然没有得到有效解决。随着计算机技术以及测量技术的迅猛发展,实现MHK三级口语开放性试题的计算机自动评分成为了可能。其一,小型化、高性能、高速的服务器以及云计算、人工智能技术的运用为实现自动评阅奠定了坚实的基础;其二,科大讯飞等公司在模
随着互联网的普及和信息化的迅猛发展,当代社会形成了由文字、图像、声音等多种符号互相组合构成的多模态现象,图像以其“一图胜千言”的优势很好地适应了信息爆炸时代人们快速阅读的需求。本文从图像时代的产生背景展开,一方面,以结构主义语言学和认知语言学理论为基础,深入分析图像、文字、语言和人类思维的关系,提出图像和文字一样,作为一种符号和人类的思维密切相关,这种“图像思维”已成为当代人类语言能力的表现之一;
在省级监测中,如果测试工具对某些团体有利而对另一些团体不利的话,测试工具就缺乏公平性,群体之间的差异比较也就无从谈起。因此,有必要对测试工具进行公平性检测。题目功能差异(differential item functioning,以下简称DIF)从测试工具的最小单位一题目水平上来探讨测试的公平性问题,通过科学、有效的方法检测出测试工具中每一个可能对目标群体的受测者产生不公平对待的题目,从而确保测试
计算机化自适应测验(Computerized Adaptive Testing,CAT)是一种量体裁衣式的新型测验模式.CAT实施的前提是有一个题目参数已经准确标定的题库,而且题库的维护与管理对于CAT的连续使用尤为重要(Chang&Lu,2010).比如CAT实施一段时间后,题库中某些题目可能会因为过度曝光、过时等原因不再适合被继续使用(Wainer&Mislevy, 1990),因此需要开发新