论文部分内容阅读
摘要:正则化稀疏模型可以通过选择合适变量进行建模,降低模型复杂度的同时,提高模型的泛化能力及模型可解释性。本文利用2013-2016年度A股制造业部分公司财务数据,建立了三种基于Logistic 回归的正则化稀疏财务预警模型,而后比较了各个模型的变量选择能力、模型可解释性及模型泛化能力。研究表明:相对于Lasso正则化模型而言,MCP、SCAD模型选择变量的能力、模型可解释性及泛化能力更强。
关键词:Lasso;SCAD;MCP;财务预警模型
引言
有效的财务预警模型将会对公司财务状况有合理的预测。自1968年Altman提出Z分数判别模型以来,国内外学者对财务预警模型进行了大量的研究,主要成果可以分为统计分析和机器学习两大类,一般认为,传统机器学习建模由于其黑盒效应限制了其实际应用,统计学中Logistic回归模型解释性较好,但直接使用也会面临着模型泛化能力不足等问题,因此选择合适的变量是Logistic回归建模的关键[1]。Lasso、SCAD、MCP是三种常见的具有选择合适变量能力的正则化稀疏模型。本文利用A股制造业部分公司财务数据建立了基于Lasso、SCAD、MCP的Logistic回归财务预警模型,并对模型比较分析。以期对财务困境相关研究和财务预警模型的实际应用提供一定的参考。
1 财务预警模型的建立
1.1模型简介
1996年首次提出使用Lasso方法进行变量选择。Zou 2006年在惩罚函数中回归系数上增加了权,以改善其在参数选择时的Oracle性质[2]。其罚项定义如式(1)所示:
1.2 实证分析
1.2.1 样本及财务指标选取
本文以A股制造业部分公司作为研究对象,参照国内外已有的相关研究成果,将被ST或者*ST的公司定义为遭遇财务困境的公司。考虑到财务分析指标可比性与样本量的大小,选择 *ST的公司40家,同时按照行业分类标准进行配对选取非*ST公司80家,随机选取其中88家作为训练集,其余32家作为测试集,根据指标可比性,可测性,全面性等特征,选择出了反映公司偿债能力、营运能力、盈利能力、发展能力、现金流动能力、風险水平、比率结构的29个财务指标。
1.2.2 模型拟合结果及分析
本文用R语言作为数据处理工具,为了避免财务分析指标数据水平的差异及计算时四舍五入带来的误差,首先对训练数据进行标准化处理,然后采用十折交叉验证的方法,惩罚项所涉及的参数由使交叉验证误差达到最小时的参数确定。虽然在数据处理前本文进行了数据的标准化处理,但是对于Logistic回归来说并不能消除截距项,表1是将被*ST处理的公司作为1,非*ST公司作为0时的数据处理结果:
变量x1-x9为企业的偿债能力变量,通过模型拟合,系数不为零的变量有速动比率x3,其越大,越不容易发生财务困境,同时我们可以得知即将发生财务困境的上市公司速动比率会显著降低。
变量x10-x13为企业的营运能力变量,MCP、SCAD模型拟合的结果系数均为零,Lasso模型拟合的系数不为零的有存货周转率x11,根据财务常识,存货周转率越大说明公司存货管理能力越强,越不容易发生财务困境。然而Lasso模型拟合的结果却与财务常识相反。
变量X14-x17为企业的盈利能力变量,通过模型拟合,系数不为零的有净资产收益率x15,其越大,越不容易发生财务困境。
变量x18-x20代表企业的发展能力,系数均为零,结合全球的经济放缓以及国家经济结构的调整背景,很多传统的制造业面临着转型,因此在*ST与非*ST公司之间没有显著差别是可以理解的。
变量x21-x23为企业的现金流量水平,系数不为零的有营业收入现金净含量x21,现金流量水平是衡量财务状况的一个重要指标,很多企业破产的直接原因是现金流断裂。
变量x24、x25分别是企业的财务杠杆、经营杠杆,其中经营杠杆大小是发生财务困境的一个重要因素。
变量x26-x29是企业的资产比率结构,不为零的系数有应收类资产比率x27以及流动资产比率x28,应收类资产以及流动资产比例越高,发生财务困境的可能性越小。
从模型拟合输出的数据分析可以看出,对于制造业企业来说,保持一定的资产流动性水平是避免财务困境的关键点,同时盈利能力也是重要影响因素。运用有限的企业资源,保持合理的资本结构与财务结构,同时提高产品竞争力,增强企业的盈利能力对于避免出现财务困境来说是非常有必要的。
1.2.3模型比较
通过比较不难发现,MCP、SCAD两种惩罚函数构建的Logistic模型不管对于训练集还是测试集的预测能力都基本相当,且两种模型对变量选择的结果甚至是系数大小均无重大差异。而Lasso方法与MCP、SCAD对训练集拟合能力相当,但是泛化能力较弱。值得一提的是,在MCP、SCAD惩罚函数构建的正则化稀疏模型中,最终用来预测的变量只有6个,而Lasso构建的模型有8个系数,其泛化能力却终究不及MCP、SCAD方法,甚至存货周转率x11这个变量的系数正负与我们根据财务常识得到的结论相反。另外,根据财务常识应收类资产本为流动资产的一部分,二者占总资产的比率存在强相关是毫无疑问的,但是Lasso方法最终将X27、X28这两个变量却同时选入了模型。
2 结论
财务预警模型是一个经久不衰的课题。本文建立了三种基于Logistic回归的正则化稀疏模型,并运用2013-2016年度部分制造业公司财务数据进行了模型的训练、测试和分析,最后从财务与统计的角度分析了各个模型的可解释性及泛化能力。结果表明,MCP、SCAD方法在模型精度、模型可解释性及模型泛化能力方面均有显著优势。
参考文献:
[1]胡小宁,何晓群,马学俊。基于Group MCP Logistic模型的个人信用评价分析[J]。现代管理科学,2015,(8)。
[2]Zou H. The Adaptive Lasso and Its Oracle Properties[J]. Journal of the American Statistical Association,2006,101(476).
[3]Fan J,Li R. Variable Selection via Nonconvex Penalized Likelihood and Its Oracle Properties[J]. Journal of the American Statistical Association,2001,96(456).
[4]hang C H. Nearly Unbiased Variable Selection under Minimax Concave Penalty[J]. Annals of Statistics,2010,38(2).
[5]Patrick Breheny,Jian Huang. Coordinate Descent Algorithms for Nonconvex Penalized Regression,with Applications to Biological Feature Selection[J]. Ann Appl Stat,2011,5(3).
[6]Deron Liang,Chih-Fong Tsai,Hsin-Ting Wu. The Effect of Feature Selection on Financial Distress Prediction[J]. Knowledge-Based Systems,2014,(73).
作者简介:
陈攀攀(1989-),男,河南周口人,硕士研究生,研究方向:机器学习。
关键词:Lasso;SCAD;MCP;财务预警模型
引言
有效的财务预警模型将会对公司财务状况有合理的预测。自1968年Altman提出Z分数判别模型以来,国内外学者对财务预警模型进行了大量的研究,主要成果可以分为统计分析和机器学习两大类,一般认为,传统机器学习建模由于其黑盒效应限制了其实际应用,统计学中Logistic回归模型解释性较好,但直接使用也会面临着模型泛化能力不足等问题,因此选择合适的变量是Logistic回归建模的关键[1]。Lasso、SCAD、MCP是三种常见的具有选择合适变量能力的正则化稀疏模型。本文利用A股制造业部分公司财务数据建立了基于Lasso、SCAD、MCP的Logistic回归财务预警模型,并对模型比较分析。以期对财务困境相关研究和财务预警模型的实际应用提供一定的参考。
1 财务预警模型的建立
1.1模型简介
1996年首次提出使用Lasso方法进行变量选择。Zou 2006年在惩罚函数中回归系数上增加了权,以改善其在参数选择时的Oracle性质[2]。其罚项定义如式(1)所示:
1.2 实证分析
1.2.1 样本及财务指标选取
本文以A股制造业部分公司作为研究对象,参照国内外已有的相关研究成果,将被ST或者*ST的公司定义为遭遇财务困境的公司。考虑到财务分析指标可比性与样本量的大小,选择 *ST的公司40家,同时按照行业分类标准进行配对选取非*ST公司80家,随机选取其中88家作为训练集,其余32家作为测试集,根据指标可比性,可测性,全面性等特征,选择出了反映公司偿债能力、营运能力、盈利能力、发展能力、现金流动能力、風险水平、比率结构的29个财务指标。
1.2.2 模型拟合结果及分析
本文用R语言作为数据处理工具,为了避免财务分析指标数据水平的差异及计算时四舍五入带来的误差,首先对训练数据进行标准化处理,然后采用十折交叉验证的方法,惩罚项所涉及的参数由使交叉验证误差达到最小时的参数确定。虽然在数据处理前本文进行了数据的标准化处理,但是对于Logistic回归来说并不能消除截距项,表1是将被*ST处理的公司作为1,非*ST公司作为0时的数据处理结果:
变量x1-x9为企业的偿债能力变量,通过模型拟合,系数不为零的变量有速动比率x3,其越大,越不容易发生财务困境,同时我们可以得知即将发生财务困境的上市公司速动比率会显著降低。
变量x10-x13为企业的营运能力变量,MCP、SCAD模型拟合的结果系数均为零,Lasso模型拟合的系数不为零的有存货周转率x11,根据财务常识,存货周转率越大说明公司存货管理能力越强,越不容易发生财务困境。然而Lasso模型拟合的结果却与财务常识相反。
变量X14-x17为企业的盈利能力变量,通过模型拟合,系数不为零的有净资产收益率x15,其越大,越不容易发生财务困境。
变量x18-x20代表企业的发展能力,系数均为零,结合全球的经济放缓以及国家经济结构的调整背景,很多传统的制造业面临着转型,因此在*ST与非*ST公司之间没有显著差别是可以理解的。
变量x21-x23为企业的现金流量水平,系数不为零的有营业收入现金净含量x21,现金流量水平是衡量财务状况的一个重要指标,很多企业破产的直接原因是现金流断裂。
变量x24、x25分别是企业的财务杠杆、经营杠杆,其中经营杠杆大小是发生财务困境的一个重要因素。
变量x26-x29是企业的资产比率结构,不为零的系数有应收类资产比率x27以及流动资产比率x28,应收类资产以及流动资产比例越高,发生财务困境的可能性越小。
从模型拟合输出的数据分析可以看出,对于制造业企业来说,保持一定的资产流动性水平是避免财务困境的关键点,同时盈利能力也是重要影响因素。运用有限的企业资源,保持合理的资本结构与财务结构,同时提高产品竞争力,增强企业的盈利能力对于避免出现财务困境来说是非常有必要的。
1.2.3模型比较
通过比较不难发现,MCP、SCAD两种惩罚函数构建的Logistic模型不管对于训练集还是测试集的预测能力都基本相当,且两种模型对变量选择的结果甚至是系数大小均无重大差异。而Lasso方法与MCP、SCAD对训练集拟合能力相当,但是泛化能力较弱。值得一提的是,在MCP、SCAD惩罚函数构建的正则化稀疏模型中,最终用来预测的变量只有6个,而Lasso构建的模型有8个系数,其泛化能力却终究不及MCP、SCAD方法,甚至存货周转率x11这个变量的系数正负与我们根据财务常识得到的结论相反。另外,根据财务常识应收类资产本为流动资产的一部分,二者占总资产的比率存在强相关是毫无疑问的,但是Lasso方法最终将X27、X28这两个变量却同时选入了模型。
2 结论
财务预警模型是一个经久不衰的课题。本文建立了三种基于Logistic回归的正则化稀疏模型,并运用2013-2016年度部分制造业公司财务数据进行了模型的训练、测试和分析,最后从财务与统计的角度分析了各个模型的可解释性及泛化能力。结果表明,MCP、SCAD方法在模型精度、模型可解释性及模型泛化能力方面均有显著优势。
参考文献:
[1]胡小宁,何晓群,马学俊。基于Group MCP Logistic模型的个人信用评价分析[J]。现代管理科学,2015,(8)。
[2]Zou H. The Adaptive Lasso and Its Oracle Properties[J]. Journal of the American Statistical Association,2006,101(476).
[3]Fan J,Li R. Variable Selection via Nonconvex Penalized Likelihood and Its Oracle Properties[J]. Journal of the American Statistical Association,2001,96(456).
[4]hang C H. Nearly Unbiased Variable Selection under Minimax Concave Penalty[J]. Annals of Statistics,2010,38(2).
[5]Patrick Breheny,Jian Huang. Coordinate Descent Algorithms for Nonconvex Penalized Regression,with Applications to Biological Feature Selection[J]. Ann Appl Stat,2011,5(3).
[6]Deron Liang,Chih-Fong Tsai,Hsin-Ting Wu. The Effect of Feature Selection on Financial Distress Prediction[J]. Knowledge-Based Systems,2014,(73).
作者简介:
陈攀攀(1989-),男,河南周口人,硕士研究生,研究方向:机器学习。