论文部分内容阅读
摘 要:城市发展分析已成为当代社会关注和研究的焦点。如今许多城市的经济发展不仅处于一种非平衡的状态,而且地域差异性也日趋明显。对原始数据进行无量纲化和线性化的改进,运用改进的主成分分析对城市综合发展实力进行分析,指出各城市间的差异和经济地位。
关键词:主成分分析 聚类分析 城市发展差异
一、引言
主成分分析法通过降维技术运用部分具有代表性的综合指标代表原始的多个变量指标的统计分析方法。但在实际应用中,主成分分析法存在很多不足,很多学者从不同角度提出了改进方法。白雪梅、赵松山提出了解决数据无量纲化处理方法。徐雅静、汪远征提出数据均值化的处理方法。阎慈琳认为不同的特征向量组合影响综合评价的结果而采用第一主成分进行评价。童新安、许超采用中心标准化进行无量纲化的处理。陈述云、张崇甫认为主成分分析所采用的线性分析有碍于对定量综合评价做出定性分析,并提出非线性主成分分析的方法。以上研究均未解决第一主成分贡献率不足对评优排序所带来的影响,并且对原始数据采取不同的处理方法,根据第一主成分分值进行评优排序的结果也会不同。文章在以上研究基础上先对原始数据进行均值化、对数化、对数中心化、传统标准化处理,将以上几种方法的主成分得分再次进行主成分分析,然后选取第一主成分进行聚类分析,在很大程度上减少了因原始数据处理方法的不同所造成的误差。
二、传统主成分-聚类分析
主成分-聚类就是先对原始数据进行处理,然后进行主成分分析,再进行聚类分析,具体操作如下:
1.将原始数据按照传统标准化进行相关处理;
2.计算相关系数矩阵为原始系数的相关系数,,其中
3.计算系数矩阵的特征值与特征向量。根据特征方程,求出矩阵的特征值,将特征值按大小排序;求出特征值对应的特征向量,要求。
4.计算累计贡献率并确定主成分个数。第个主成分的累积贡献率:,若前个特征值的累积贡献率达到了85%-95%,则这前个特征值所对应的新变量为原始变量的第、第、…、第个主成分。
5.计算原始变量在个主成分上的得分。计算出前个主成分的载荷矩阵,将载荷代入下列方程组,即可计算得到前个主成分的得分。
6.根据第一主成分得分进行聚类分析。
三、改进的主成分-聚类分析
1.原始数据无量纲化的改进。主成分分析的关键是依据协方差矩阵求出主成分,但是协方差矩阵容易受原始数据的量纲和数量级的影响。事实上,协方差矩阵能完整的反映原始数据指标的全部信息。而“均值化”后得到的协方差矩阵能够完全反映原始数据指标所包含的全部信息,因此,可以把“均值化”作为一种新的无量纲化方法。设原始数据,令,,得到数据矩阵。设的协方差矩阵,由于中每个列向量的均值都为1,则:
其中为原始数据的协方差矩阵,特别地当时,。
2.原始数据的线性化。在实际应用中,原始数据各指标之间往往呈现出非线性相关的关系。如果采取传统的主成分分析,就会导致评价结果与事实之间的误差很大,所以必须对传统主成分线性降维的方法进行改进。常用方法有“对数中心化”、“对数化”,这里主要对“对数中心化”方法进行介绍。
设有个指标的原始数据,对原始数据作对数中心化变换;计算对数中心化数据的样本协方差矩阵,。从出发求主成分:设是的个特征根,是相应的标准化特征向量,则第个非线性主成分为:,余下步骤和传统主成分分析一样。
3.改进的主成分-聚类分析。首先对原始数据分别进行均值化、对数化、对数中心化、传统标准化处理,然后进行对应的主成分分析。由于不同的数据处理方法对评价结果有一定的误差,由此将以上几种方法的主成分得分再次进行主成分分析,然后选取第一主成分得分进行聚类分析,在很大程度上减少了因原始数据处理方法的方不同所造成的误差。
四、应用与实例
1.经济指标的选取。根据合理性、科学性原则选取了由以下11个经济指标组成的指标体系(数据来源于《河南省统计年鉴-2014》):-地区生产总值/亿元;-人均生产总值(GDP)/元;-第三产业增加值/亿元 ;-规模以上工业增加值/亿元;-全社会固定资产投资/亿元;-公共财政预算收入/万元;-进出口总额/万美元;-城镇单居民人均可支配收入/元;-农村居民人均纯收入/元;-社会消费品零售额/亿元;-各市居民消费水平/元。
2.城市综合发展差异分析。将原始数据运用MATLAB和SPSS进行处理,然后运用SPSS软件分别进行主成分分析,得到各个方法的城市排名。从结果中发现鹤壁、漯河、商丘、周口、济源在传统标准化排名中与其他三种方法的结果出入较大。从原始数据中观察商丘、漯河在地区生产总值、第三产业增加值、规模以上工业增加值、全社会固定资产投资、公共财政预算收入、社会消费品零售额方面比济源高出很多,周口在地区生产总值、规模以上工业增加值,全社会固定资产投资、公共财政预算收入、进出口总额、社会消费品零售额方面很突出,所以传统标准化主成分分析存在不足。为此我们根据均值化主成分分析、对数中心化主成分分析、对数化主成分分析的得分再一次进行主成分分析,以第一主成分得分重新排名。
计算发现第一主成分累积贡献率达到了95.406%,充分说明第一主成分几乎能够包含原始数据的所有信息。第一主成分计算公式:,其中分别表示以上三种主成分分析的得分。最后得到如下排名:郑州、洛阳、南阳、焦作、许昌、新乡、安阳、平顶山、周口、开封、信阳、三门峡、商丘、驻马店、濮阳、漯河、济源、鹤壁。运用SPSS软件进行聚类分析,对河南省的18个城市的经济发展程度进行排序。根据聚类分析系谱图,对河南省各地市的发展程度分四类,第一类综合发展程度高的城市:郑州市;第二类综合发展程度较高的城市:洛阳、南阳、焦作、许昌、新乡、安阳;第三类综合发展程度一般的城市:平顶山、周口、开封、信阳、三门峡、商丘、驻马店、濮阳;第四类综合发展程度低的城市:漯河、济源、鹤壁。
3.发展建议。郑州总体发展较快,要加快高新技术工业、信息业的发展,注重整合优化各种资源,在全省范围内发挥引领和带动作用。洛阳应当利用其历史文化和旅游资源的优势加快经济发展,努力成为省内的经济先导城市和旅游名城。南阳、平顶山等其他城市加强与大城市之间的经济交流和合作,发展新兴工业,引进外商投资。漯河、鹤壁、济源经济发展缓慢,今后首先应先发展城市基础设施建设,努力发展自身优势产业,优化资源配置。
五、结语
通过对原始数据进行无量纲化和线性化的改进,解决了按照不同数据处理方法而影响各个指标的排名的问题。而改进的主成分-聚类分析方法综合了以上四种方法的主成分得分进行主成分分析再聚类分析,在很大程度上减少了由于计算方法的不同所造成的误差,使主成分分析法的应用得到深入。
参考文献:
[1]白雪梅,赵松山.对主成分分析综合评价方法若干问题的探讨[J].统计研究,1995.68(16):47-51.
[2]徐雅静,汪远征.主成分分析应用方法的改进[J].数学实践与认识,2006,6(36):69-71.
[3]阎慈琳.关于主成分分析作综合评价的若干问题[J].数理统计与管理,1998,17(2):22-25.
[4]童新安,許超.基于非线性主成分和聚类分析的综合评价方法[J].统计与信息论坛,2008,23(2):37-46.
[5] 陈述云,张崇甫.多元指标综合评价的主成分分析方法的改进[J].统计研究,1995.63(1):35-39.
[6] 叶双峰.关于主成分分析做综合评价的改进[J].数据统计与管理,2001,02(20):52-54. [7] 河南省统计局.河南统计年鉴[M].北京:中国统计出版社,2014.
关键词:主成分分析 聚类分析 城市发展差异
一、引言
主成分分析法通过降维技术运用部分具有代表性的综合指标代表原始的多个变量指标的统计分析方法。但在实际应用中,主成分分析法存在很多不足,很多学者从不同角度提出了改进方法。白雪梅、赵松山提出了解决数据无量纲化处理方法。徐雅静、汪远征提出数据均值化的处理方法。阎慈琳认为不同的特征向量组合影响综合评价的结果而采用第一主成分进行评价。童新安、许超采用中心标准化进行无量纲化的处理。陈述云、张崇甫认为主成分分析所采用的线性分析有碍于对定量综合评价做出定性分析,并提出非线性主成分分析的方法。以上研究均未解决第一主成分贡献率不足对评优排序所带来的影响,并且对原始数据采取不同的处理方法,根据第一主成分分值进行评优排序的结果也会不同。文章在以上研究基础上先对原始数据进行均值化、对数化、对数中心化、传统标准化处理,将以上几种方法的主成分得分再次进行主成分分析,然后选取第一主成分进行聚类分析,在很大程度上减少了因原始数据处理方法的不同所造成的误差。
二、传统主成分-聚类分析
主成分-聚类就是先对原始数据进行处理,然后进行主成分分析,再进行聚类分析,具体操作如下:
1.将原始数据按照传统标准化进行相关处理;
2.计算相关系数矩阵为原始系数的相关系数,,其中
3.计算系数矩阵的特征值与特征向量。根据特征方程,求出矩阵的特征值,将特征值按大小排序;求出特征值对应的特征向量,要求。
4.计算累计贡献率并确定主成分个数。第个主成分的累积贡献率:,若前个特征值的累积贡献率达到了85%-95%,则这前个特征值所对应的新变量为原始变量的第、第、…、第个主成分。
5.计算原始变量在个主成分上的得分。计算出前个主成分的载荷矩阵,将载荷代入下列方程组,即可计算得到前个主成分的得分。
6.根据第一主成分得分进行聚类分析。
三、改进的主成分-聚类分析
1.原始数据无量纲化的改进。主成分分析的关键是依据协方差矩阵求出主成分,但是协方差矩阵容易受原始数据的量纲和数量级的影响。事实上,协方差矩阵能完整的反映原始数据指标的全部信息。而“均值化”后得到的协方差矩阵能够完全反映原始数据指标所包含的全部信息,因此,可以把“均值化”作为一种新的无量纲化方法。设原始数据,令,,得到数据矩阵。设的协方差矩阵,由于中每个列向量的均值都为1,则:
其中为原始数据的协方差矩阵,特别地当时,。
2.原始数据的线性化。在实际应用中,原始数据各指标之间往往呈现出非线性相关的关系。如果采取传统的主成分分析,就会导致评价结果与事实之间的误差很大,所以必须对传统主成分线性降维的方法进行改进。常用方法有“对数中心化”、“对数化”,这里主要对“对数中心化”方法进行介绍。
设有个指标的原始数据,对原始数据作对数中心化变换;计算对数中心化数据的样本协方差矩阵,。从出发求主成分:设是的个特征根,是相应的标准化特征向量,则第个非线性主成分为:,余下步骤和传统主成分分析一样。
3.改进的主成分-聚类分析。首先对原始数据分别进行均值化、对数化、对数中心化、传统标准化处理,然后进行对应的主成分分析。由于不同的数据处理方法对评价结果有一定的误差,由此将以上几种方法的主成分得分再次进行主成分分析,然后选取第一主成分得分进行聚类分析,在很大程度上减少了因原始数据处理方法的方不同所造成的误差。
四、应用与实例
1.经济指标的选取。根据合理性、科学性原则选取了由以下11个经济指标组成的指标体系(数据来源于《河南省统计年鉴-2014》):-地区生产总值/亿元;-人均生产总值(GDP)/元;-第三产业增加值/亿元 ;-规模以上工业增加值/亿元;-全社会固定资产投资/亿元;-公共财政预算收入/万元;-进出口总额/万美元;-城镇单居民人均可支配收入/元;-农村居民人均纯收入/元;-社会消费品零售额/亿元;-各市居民消费水平/元。
2.城市综合发展差异分析。将原始数据运用MATLAB和SPSS进行处理,然后运用SPSS软件分别进行主成分分析,得到各个方法的城市排名。从结果中发现鹤壁、漯河、商丘、周口、济源在传统标准化排名中与其他三种方法的结果出入较大。从原始数据中观察商丘、漯河在地区生产总值、第三产业增加值、规模以上工业增加值、全社会固定资产投资、公共财政预算收入、社会消费品零售额方面比济源高出很多,周口在地区生产总值、规模以上工业增加值,全社会固定资产投资、公共财政预算收入、进出口总额、社会消费品零售额方面很突出,所以传统标准化主成分分析存在不足。为此我们根据均值化主成分分析、对数中心化主成分分析、对数化主成分分析的得分再一次进行主成分分析,以第一主成分得分重新排名。
计算发现第一主成分累积贡献率达到了95.406%,充分说明第一主成分几乎能够包含原始数据的所有信息。第一主成分计算公式:,其中分别表示以上三种主成分分析的得分。最后得到如下排名:郑州、洛阳、南阳、焦作、许昌、新乡、安阳、平顶山、周口、开封、信阳、三门峡、商丘、驻马店、濮阳、漯河、济源、鹤壁。运用SPSS软件进行聚类分析,对河南省的18个城市的经济发展程度进行排序。根据聚类分析系谱图,对河南省各地市的发展程度分四类,第一类综合发展程度高的城市:郑州市;第二类综合发展程度较高的城市:洛阳、南阳、焦作、许昌、新乡、安阳;第三类综合发展程度一般的城市:平顶山、周口、开封、信阳、三门峡、商丘、驻马店、濮阳;第四类综合发展程度低的城市:漯河、济源、鹤壁。
3.发展建议。郑州总体发展较快,要加快高新技术工业、信息业的发展,注重整合优化各种资源,在全省范围内发挥引领和带动作用。洛阳应当利用其历史文化和旅游资源的优势加快经济发展,努力成为省内的经济先导城市和旅游名城。南阳、平顶山等其他城市加强与大城市之间的经济交流和合作,发展新兴工业,引进外商投资。漯河、鹤壁、济源经济发展缓慢,今后首先应先发展城市基础设施建设,努力发展自身优势产业,优化资源配置。
五、结语
通过对原始数据进行无量纲化和线性化的改进,解决了按照不同数据处理方法而影响各个指标的排名的问题。而改进的主成分-聚类分析方法综合了以上四种方法的主成分得分进行主成分分析再聚类分析,在很大程度上减少了由于计算方法的不同所造成的误差,使主成分分析法的应用得到深入。
参考文献:
[1]白雪梅,赵松山.对主成分分析综合评价方法若干问题的探讨[J].统计研究,1995.68(16):47-51.
[2]徐雅静,汪远征.主成分分析应用方法的改进[J].数学实践与认识,2006,6(36):69-71.
[3]阎慈琳.关于主成分分析作综合评价的若干问题[J].数理统计与管理,1998,17(2):22-25.
[4]童新安,許超.基于非线性主成分和聚类分析的综合评价方法[J].统计与信息论坛,2008,23(2):37-46.
[5] 陈述云,张崇甫.多元指标综合评价的主成分分析方法的改进[J].统计研究,1995.63(1):35-39.
[6] 叶双峰.关于主成分分析做综合评价的改进[J].数据统计与管理,2001,02(20):52-54. [7] 河南省统计局.河南统计年鉴[M].北京:中国统计出版社,2014.