论文部分内容阅读
频度、匀度和信息熵是语言的计量研究中极为重要的指标,本文对均方匀度、熵匀度和均根匀度进行了系统的比较研究,并针对均根匀度进行了深入的探索,得到了二元均根匀度和多元均根匀度的合理定义、基于相似度的熵和基于隶属度的熵,并以均根匀度为依据检验了新发现的与汉语相关的三个基本统计规律。以下为具体结果:
1.梳理了以前的研究中使用的“分布率、使用度、通用度、散布系数(散布率、散布度)”等概念和名称,提出使用“匀度”一词来描述一个词语在语料库中分布的均匀程度,并将常用的三种匀度指标分类命名为“均方匀度”、“均根匀度”和“熵匀度”。
2.提出了检验匀度度量指标合理性的三条准则:
a)在n等分的情况下应该与人的直觉相符合,如只在m个等分中以相同次数出现则其匀度应该为m/n:
b)在将划分逐步进行合并时,匀度的值应该保持不减;
c)在非等分的情况下,将出现的相对频度相同的几个部分进行合并,匀度的值应保持不变。
并以此准则对现有匀度指标进行检验,发现均方匀度和熵匀度均不符合,只有均根匀度完全符合以上三条准则。
3.把平方加权均根匀度应用于汉语广义虚词的界定,利用该指标验证了广义虚词应该包括传统虚词、方位词和动词中的形式动词、助动词和趋向动词的结论;并对形式动词的范围进行了适当推广,给出关于副词的“虚实之辨”的一个解决方案。
4.用二元均根匀度检验了以下统计规律:一个更好地描述汉字的频序关系的公式;一个更好地描述汉字的笔画数分布的公式--幂正态分布,平方根正态分布为其特例;对数正态分布对汉语句长分布(基于人民日报语料库)具有更好的描述能力。
5.从对阿罗不可能定理的公理基础的质疑出发,基于“只有可消解的不确定性才有对应的信息量”提出了基于相似度的熵和基于隶属度的熵,使信息熵的计算能够把随机性和模糊性统一在一起进行考虑。
通过对均方匀度和熵匀度的检验发现其不符合本文提出的三条准则,通过对均根匀度的扩展使其也能用于二元和多元的情况,本文建立了一个评价和扩展匀度度量指标的自洽体系。