论文部分内容阅读
【关键词】 知识图谱; 商业银行; 内部审计; 担保; PageRank; 图数据库
【中图分类号】 F239;C931.6 【文献标识码】 A 【文章编号】 1004-5937(2021)22-0115-05
一、引言
知识图谱是以图的形式来描述世界万物及其关系的建模方法[ 1 ]。知识图谱技术可以直观、明了、形象地刻画出审计关注对象(如客户、员工、分支机构、股东、监管机构、同业、供应商、合作伙伴等)之间的关联网络,并从多维度呈现审计对象的真实属性和复杂多样的连接关系,避免了抽样风险,降低了审计风险,提升了内部审计的工作效率和效果。本文基于大数据语言和开源工具软件,构建了改进的知识图谱技术实现方法,对商业银行担保业务审计高阶模型进行了尝试和探索,有助于审计人员快速把握审计重点,并掌握新型的审计思路,为内部审计数字化转型提供参考。
二、研究回顾
(一)知识图谱简介
知识图谱基于语义网络,能够客观描述实体之间或概念之间的复杂关联关系。知识图谱的构建涉及节点抽取、属性定义、关系建立、图形展示、关系优化等多方面技术,而知识图谱的应用涉及自然语言处理(NLP)、数据挖掘、机器学习、深度学习(Deep Learning)、人工智能等方面技术。
知识图谱由节点和边组成。节点可以是具象实体,如某个机构、某位客户等,也可以是抽象概念,如精品盈利、最佳服务等。边可以是实体的属性,如联系方式、通信地址,也可以是实体之间的关系,如股东、供应商。知识图谱的初始理念是把用文本实现链接的传统网络转化成具备一定智能、通过实体链接、能够理解逻辑关系的语义网(Semantic)[ 2-3 ]。
1994年,Tim Berners-Lee提出网络不应该只是网页之间的互相链接。因为在现实生活中,网站描述的都是现实世界中存在的具体实物或者人脑中存在的抽象概念,网页之间的链接应当体现这些实体或概念之间的关联关系。但是当时计算机无法有效地从网页中识别出其中相关语义。Tim Berners-Lee于1998年提出了Semantic
Web的概念[ 4 ]。与传统的基于网页的互联网不同,Semantic Web的本质是基于事物(Web of Things),通过图和链接的组织方式进行呈现。图中节点不仅支持网页,而且支持具象实体或抽象概念。图中边代表超链接,增加了语义描述,用于标明实体之间的关联关系。
在Semantic Web概念之后,大量新兴语义和知识库开始涌现,如亚马逊公司的True Knowledge,谷歌公司的Freebase,IBM公司的Yago等。谷歌公司在2010年收购了MetaWeb公司,并以其Freebase产品为基础,于2012年推出基于知识图谱的搜索引擎。之后,知识图谱开始在智能问答、舆情分析、数据挖掘、机器学习、深度学习等领域凸显出越来越重要的作用。
(二)PageRank算法简介
谷歌公司革命性的发明是“PageRank”网页排名算法。该算法最初用于互联网网页搜集,在1998年前后使得网络搜索实现质的飞跃。该算法会通过一定规则确定出每个网页的PageRank(PR)值来衡量网页的重要程度,然后对PR值进行大小排序[ 5 ]。在互联网,当某网页被多个网页所指向或链接,说明它受到认可和信赖,其重要程度就高;如果某网页没有被指向或链接多次,但被其他重要的网页指向和链接,那么该网页重要程度也高。网页的PR值主要受到三个因素影响,分别是指向该网页的前置网页数量、指向该网页的前置网頁重要程度和该网页背向指出数量。网页PR值的计算方法如公式(1)所示。其中,PR(A)、PR(B)、PR(C)分别表示网页A、B、C的PR值,L(B)、L(C)、L(D)分别表示网页B、C、D的出链数。
如果用向量B=(b1,b2,…,bn)T表示各网页的排名值,用Bi表示第i次迭代结果,用矩阵A=a11 … a1m … a1n… … … … …am1 … amm … amn… … … … …an1 … anm … ann表示网页之间的转移概率,其中amn表示第m个网页指向第n个网页的链接概率,那么可以用公式(2)表示网页排名情况。其中,Bi表示i时刻的网页排名情况,Bi-1表示前一时刻的网页排名情况。
在公式(2)经过数次迭代趋于收敛后,可以得到公式(3):
由于存在某些孤立网页不指向其他任何网页的特殊情况,转移矩阵A往往为稀疏矩阵。为了解决小概率事件下稀疏矩阵的运算问题,引入常数?琢进行平滑处理,得到公式(4)。其中N是互联网网页的数量,I是单位矩阵,?琢为介于0到1之间的常数,一般取0.15。
PageRank算法在数据挖掘与知识图谱中的研究和应用越来越多,尤其在社群识别(Community Identification)方面效果非常明显。商业银行在内部审计中可以运用PageRank算法,将审计关注对象作为网络中的节点,通过各种关联关系构建有向图,然后计算转移概率,再通过迭代,得到满足收敛条件的PR值,进而识别出可疑个体及其关联团体。
三、商业银行担保业务审计重点及存在困难
当前,国内外宏观经济发展处于下行期。商业银行为规避社会信用环境恶化风险,主动压降信用贷款,发展担保贷款加强风险补偿。在实践工作中,担保贷款管理不到位给银行信贷资产造成损失的案例层出不穷,成为商业银行内部审计必须关注的重点。
广义担保包括保证、质押和抵押等,是指商业银行通过改变信贷风险轮廓来影响借款人的违约损失率或违约概率,从而降低其信用风险。狭义担保特指保证,是指商业银行与保证人约定,如果借款人不履行债务,保证人将承担履行债务的责任[ 6 ]。担保的最大特点是以第三人的信用来实现债务履约。在本文中,担保特指狭义担保。 (一)银行担保审计关注重点
第一还款来源是指借款人从事生产经营及相关活动而产生的、直接用于归还银行贷款的款项。第二还款来源是指当借款人无法偿还银行贷款时,通过处置抵押物、质押物或者对担保人进行追索而得到的款项。担保属于第二还款来源,为借款人违约提供事后补偿机制。商业银行必须认识到担保作为补偿机制所存在的局限性,不能过于注重担保,而弱化对借款人第一还款来源的关注。商业银行内部审计在开展担保业务审计过程中,主要关注以下方面:
(1)保证人新增对外担保情况。保证人在为本行贷款提供担保后,又为其他借款人或当前借款人他行贷款提供担保,降低了原被担保债权的保障力度,增大了本行风险。
(2)保证人财产抵押情况。保证人财产对外抵押过多,通常表明保证人自身债务负担较重,一旦保证人违约,在有限债权处置完抵押物后,保证人就成为“空壳公司”,失去代偿能力。
(3)保证人在本行贷款情况。如果保证人在本行有大额贷款,一旦借款人违约,银行在是否追索保证人时往往面临两难境地。追索保证人可能导致其不能持续经营,并会危及本行对保证人贷款的安全。
(4)借新还旧涉及保证情况。借款合同双方当事人协议以新贷款偿还旧贷款,银行与原保证人必须重签保证合同,否则保证人不承担民事责任。
(5)互保和连环担保情况。互保和连环担保在实际操作中往往很难追偿。经济上行期,企业“抱团取暖”;经济下行期,风险扩散容易造成“火烧连营”,连环追索容易形成区域金融风险。
(6)集团母公司保证情况。重点考察集团母公司的自身经营情况、财务情况和资信情况,分析母公司的保证能力,不能以合并报表代替母公司报表。
(二)银行担保审计存在的困难
当前,商业银行内部审计数据分析基本基于Oracle、SQL Server、DB2等关系型数据库。传统方法在利用结构化查询语言(SQL)开发规则模型提取疑点的同时,也存在一些不足,主要表现在以下方面:
(1)传统关系型数据库采用笛卡尔积对数据进行搜索和匹配,在处理担保关系中涉及的多主体、多链条、多张表所面临的指数级上升的海量数据量时,存在制约瓶颈。
(2)传统关系型数据库支持选取(Select)、连接(Join)、分组汇总(Group by)、取唯一值(Unique)等算法,但是对于聚类、回归、决策树、支持向量机、神经网络等高阶算法,尤其是担保中经常涉及的有向图无能为力。
(3)传统关系型数据库以二维表的形式向审计人员呈现数据,无法以颜色、形状、大小等形式直观形象触达审计人员,需要审计人员具备较高的数据分析能力和思维抽象能力。
四、知识图谱技术应用的理论框架
构建知识图谱需要使用知识表示、图数据库、自然语言处理、机器学习等多种技术。审计人员通过构建知识图谱,可以提炼审计对象之间的关联关系组成关系网络,实现多角度机构或者人员画像,深度挖掘隐形关联,复现复杂审计场景。
(一)基于Neo4j图数据库的知识图谱实现
相对于传统的关系数据库,图数据库在处理大量的、复杂的、互连接程度高、低结构化程度低的数据方面具有优势,更便于实现基础的知识图谱功能。图数据库的基本元素为节点和边。边将有关联关系的节点链接,形成复杂网络拓扑。当在节点之间建立新的链接时,图数据库使用列表来实现直接访问,而不像传统关系数据库需要全表遍历搜索。
Neo4j图数据库是当前应用最广泛的图数据库软件,具有良好的高并发性和可扩展性,支持在一台计算机上处理数十亿个节点和边,并支持扩展到多台计算机同时运行,克服了传统关系型数据库在查询大量连接(join)关系时所出现的性能下降问题。但是默认情况下,Neo4j数据库以图的形式呈现所有的节点和关系,导致审计人员难以迅速聚焦到重点可疑样本。
(二)基于Python的知识图谱技术改进
PageRank算法于1996年由谷歌公司的Page和Brin提出,最初用于计算互联网网页重要程度。现在该算法已经成为复杂图分析的主要算法,属于机器学习中的无监督学习。PageRank算法在本质上是一阶有限离散马尔可夫链,其基本思想是在有向图上定义一个随机游走模型,呈现游走者沿图中有向边随机访问网络节点的行为。在满足一定假设条件的前提下,每个结点访问概率可以通过矩阵计算得到,即PageRank值或PR值。
Python语言的NetworkX库具有常用的复杂图和网络分析函数,可用于知识图谱的建模。使用NetworkX库的PageRank函数可以计算每个节点的PR值,使用NetworkX库的NetworkX weakly_connected_component_subgraphs函数可以把全图拆分成独立的子图。结合Python语言强大的计算能力和Neo4j图数据库强大的数据可视化呈现能力,审计人员可以灵活建模,并将PR值较高的疑点及其所有的显性或隐性担保关系进行直观呈现。
五、知识图谱技术在商业银行担保审计中的应用案例
(一)案例背景及审计思路
担保圈链内企业普遍存在融资杠杆率高、过度融资、多头授信以及对外投资房地产、股票等现象。如果个别企业发生银行履约问题,将会造成多米诺骨牌效应,最终导致圈链内所有企业受到影响。目前,担保圈链风险化解压力大,出险率较高,而部分商业银行分支机构对担保风险传导预判不足,对客户贷前调查不深入,对担保企业代偿能力分析不到位。出险前对关联关系、客户特征、多头或过度授信等风险揭示不充分,对其他银行收贷、担保代偿等情况反应滞后;出险后对借款企业担保圈链的復杂关系梳理不够清晰,对企业和实际控制人名下资产状况、对外投资信息掌握不够全面,未能有效把握化解风险的最佳时机。 (二)知识图谱技术实现途径
本文结合当下流行的开源语言Python和开源图数据库Neo4j实现了担保圈链的知识图谱,并直观展现了疑点数据。思路和步骤如图1所示。
1.数据提取
在内部审计数据分析系统中,提取担保关系表、客户信息表、资金流向表。客户信息表中含有客户的编号和名称信息,担保关系表含有担保客户编号、被担保客户编号、担保金额、担保日期等信息,资金流向表含有客户编号、客户账号、交易日期、交易金额、借贷方向、交易余额、交易对手账号、交易对手名称等信息。
2.数据清理
将信息不全的客户进行剔除,并且根据需要区分出担保关系是否已经到期。由于数据治理或历史问题,难免会有脏数据,审计人员需要对数据进行必要的清理。鉴于部分审计场景只需关注担保关系尚未结束的客户,故在此对担保关系现状进行标识。
3.数据加载和加工
Python语言的Pandas库纳入了标准数据的处理函数,可以高效地操作大型数据集。使用其中的read_X函数可以读取CSV、Excel、sql、json、html、stata等多种格式的数据。Python语言中的NetworkX库具有创建和操作复杂网络的功能,使用其中的DiGraph函数创建全网有向图。
4.子图计算
使用Python语言NetworkX库的PageRank函数,可以计算节点的重要程度(PR值);使用Python语言NetworkX库的weakly_connected_component_subgraphs函数,可以将全网拆分成不连通的子网络。两者相结合,可以将PR值高的节点所在的子网从全网中进行逐一剥离。
5.数据展现
Py2neo是一个用于从Python应用程序内部调用和处理Neo4j数据库的工具包。通过Py2neo包的Node函数在Neo4j数据库中生成包含客户信息的节点,通过Relationhan函数在Neo4j数据库中生成客户之间担保的链接、客户之间资金流向的链接。之后,Neo4j数据库即以图形化方式展现疑点数据集合。
6.现场排查
审计人员根据Python的PR值获取聚合度高的可疑节点,再通过Neo4j数据库获取相应的担保关系和资金流向关系图。审计人员结合审计线索和可视化数据,锁定重点样本后,到审计现场通过访谈、调阅、走访观察等手段进行排查和确认。数据展现效果如图2所示。
7.报告呈现
审计人员根据现场检查发现问题,对被审计对象的战略执行、企业治理、经营情况等方面進行评价,并编制成内容客观、逻辑清晰、结论明确、建议合理、重点突出的审计报告呈现给主管领导,促进企业加强问题整改、完善内部控制,必要时对责任人进行追责处理,进而使内部审计部门为企业实现“管理增值”的目标。
(三)审计发现问题
L地区曾属于国家大型钢木和家具生产基地,主要经济由钢铁冶炼及压延、木材加工、家具生产及销售等产业支撑。但是,根据国家后续规划政策,该地区属于环境治理核心区域,钢铁冶炼生产必须退出,金属加工、焊接喷漆等家具制造环节严格限制性生产。当地钢铁冶炼企业已全部停产,钢铁压延及金属加工企业多数关停,家具生产企业受制于环保及原材料异地采购成本已呈现颓势,风险爆发显示出集中性和传染性。各金融机构已对当地融资环境负面评价,抽贷情况严重,授信风险呈连锁反应。
为分析和揭示上述问题,审计组通过知识图谱模型获取疑点数据并经过现场查证后发现,L地区部分借款企业循环互保,且隶属于同一生产链并互为交易对手,对外融资主要风险缓释手段为担保,融资代偿能力不足,循环担保变为事实上的信用贷款,在区域环保治理及融资环境逐渐严峻的背景下,产业链风险波动从上游向下游顺向扩大传导,大量企业关停,生产链及资金链断裂,担保圈风险逐渐暴露。如B县X建材有限公司、L市X木业有限公司、B县X金属制品有限公司、B县X制管有限公司、H省X金属制品有限公司、H省X化工集团有限公司、W县X能源有限公司、H省X建材有限公司、L市X石油天然气销售有限公司、B县Y制管有限公司10户借款人与L市Z家具股份有限公司及其关联公司同属于当地钢木家具生产链企业,彼此既互为上下游客户,又互为循环担保人,生产链条和资金链条高度相关,物流、资金流、信息流环环相扣,融资环境系统化风险明显。上述10户借款人授信余额10.62亿元,占L区域全部授信客户户数及授信余额的35.71%和14.83%,其中关注类及以下客户7户,授信余额8.42亿元,分别占非关联企业担保授信客户户数及授信余额的70%和79.28%。
(四)整改建议
针对审计发现问题,总行领导高度重视,做出重要批示。业务主管部门举一反三,第一时间在全行范围内进行了梳理和排查,并制定出整改安排,有效避免了担保风险的扩大和集中爆发。具体整改措施包括:(1)在贷前调查阶段,除详细分析企业融资情况外,加强对“或有负债”成因分析,确认是否存在圈保、链保行为,对涉及担保圈链的客户授信准入严格把关;(2)重新评估分析保证担保的风险缓释作用,审慎将保证担保作为唯一风险缓释手段,尤其针对民营企业,必须增加其他风险缓释手段;(3)加强贷后管理,关注借款人或有负债变化情况,及时确认新增授信是否存在担保圈链情况。
六、总结及展望
随着新技术、新理念、新方法日新月异的发展,信息技术在商业银行内部审计中将发挥越来越重要的作用。本文结合项目实践,探索了知识图谱技术、PageRank算法在商业银行担保业务审计中的应用。上述模型的思路、工具和方法在其他涉及处理复杂网络的内部审计中具有通用性和参考性。
Python语言和Neo4j图数据库均为开源软件,使用成本较低,适合具有探索和创新精神的内部审计人员进行尝试。但是Python语言和Neo4j图数据库两者的组合应用尚不多见,且编程开发和软件使用有一定的应用门槛。在建模过程中,存在熟悉业务的审计人员不熟悉建模工具,熟悉软件工具的审计人员可能不熟悉业务思路,复合型人才缺失、团队需要磨合、模型反复沟通迭代的情况。
党的十九大报告中指出审计要“善于运用互联网技术信息化手段开展工作”,审计署提出审计工作人员需成为“新时代的数字化审计兵”。随着数字化转型的发展,部分商业银行已将人工智能、大数据等科技手段应用于日常审计工作中,并且更加重视复合型审计队伍的建设、多维度数据的引入、高性能数据分析平台的建设,相信知识图谱等新技术将会在内部审计中发挥越来越重要的作用。
【主要参考文献】
[1] 牛艳芳,薛岩,邓雪梅,等.审计大数据关联的网络分析平台构建及应用研究[J].审计研究,2018(5):35-42.
[2] 陈伟,居江宁.基于大数据可视化技术的审计线索特征挖掘方法研究[J].审计研究,2018(1):16-21.
[3] MING LI,XIUZHI LU,LISHENG CHEN,et al.Knowledge map construction for question and answer archives[J].Expert Systems With Applications,2020,141(1).
[4] SOYEOP YOO,OKRAN JEONG.Automating the expansion of a knowledge graph[J].Expert Systems With Applications,2020,141(1).
[5] 张芸芸,方勇,黄诚.基于Neo4j图谱的信用卡欺诈检测[J].信息与电脑(理论版),2018(21):28-30.
[6] 邝思敏.中国银行T分行中小企业信贷风险控制模式研究[D].湘潭:湘潭大学硕士学位论文,2018.
【中图分类号】 F239;C931.6 【文献标识码】 A 【文章编号】 1004-5937(2021)22-0115-05
一、引言
知识图谱是以图的形式来描述世界万物及其关系的建模方法[ 1 ]。知识图谱技术可以直观、明了、形象地刻画出审计关注对象(如客户、员工、分支机构、股东、监管机构、同业、供应商、合作伙伴等)之间的关联网络,并从多维度呈现审计对象的真实属性和复杂多样的连接关系,避免了抽样风险,降低了审计风险,提升了内部审计的工作效率和效果。本文基于大数据语言和开源工具软件,构建了改进的知识图谱技术实现方法,对商业银行担保业务审计高阶模型进行了尝试和探索,有助于审计人员快速把握审计重点,并掌握新型的审计思路,为内部审计数字化转型提供参考。
二、研究回顾
(一)知识图谱简介
知识图谱基于语义网络,能够客观描述实体之间或概念之间的复杂关联关系。知识图谱的构建涉及节点抽取、属性定义、关系建立、图形展示、关系优化等多方面技术,而知识图谱的应用涉及自然语言处理(NLP)、数据挖掘、机器学习、深度学习(Deep Learning)、人工智能等方面技术。
知识图谱由节点和边组成。节点可以是具象实体,如某个机构、某位客户等,也可以是抽象概念,如精品盈利、最佳服务等。边可以是实体的属性,如联系方式、通信地址,也可以是实体之间的关系,如股东、供应商。知识图谱的初始理念是把用文本实现链接的传统网络转化成具备一定智能、通过实体链接、能够理解逻辑关系的语义网(Semantic)[ 2-3 ]。
1994年,Tim Berners-Lee提出网络不应该只是网页之间的互相链接。因为在现实生活中,网站描述的都是现实世界中存在的具体实物或者人脑中存在的抽象概念,网页之间的链接应当体现这些实体或概念之间的关联关系。但是当时计算机无法有效地从网页中识别出其中相关语义。Tim Berners-Lee于1998年提出了Semantic
Web的概念[ 4 ]。与传统的基于网页的互联网不同,Semantic Web的本质是基于事物(Web of Things),通过图和链接的组织方式进行呈现。图中节点不仅支持网页,而且支持具象实体或抽象概念。图中边代表超链接,增加了语义描述,用于标明实体之间的关联关系。
在Semantic Web概念之后,大量新兴语义和知识库开始涌现,如亚马逊公司的True Knowledge,谷歌公司的Freebase,IBM公司的Yago等。谷歌公司在2010年收购了MetaWeb公司,并以其Freebase产品为基础,于2012年推出基于知识图谱的搜索引擎。之后,知识图谱开始在智能问答、舆情分析、数据挖掘、机器学习、深度学习等领域凸显出越来越重要的作用。
(二)PageRank算法简介
谷歌公司革命性的发明是“PageRank”网页排名算法。该算法最初用于互联网网页搜集,在1998年前后使得网络搜索实现质的飞跃。该算法会通过一定规则确定出每个网页的PageRank(PR)值来衡量网页的重要程度,然后对PR值进行大小排序[ 5 ]。在互联网,当某网页被多个网页所指向或链接,说明它受到认可和信赖,其重要程度就高;如果某网页没有被指向或链接多次,但被其他重要的网页指向和链接,那么该网页重要程度也高。网页的PR值主要受到三个因素影响,分别是指向该网页的前置网页数量、指向该网页的前置网頁重要程度和该网页背向指出数量。网页PR值的计算方法如公式(1)所示。其中,PR(A)、PR(B)、PR(C)分别表示网页A、B、C的PR值,L(B)、L(C)、L(D)分别表示网页B、C、D的出链数。
如果用向量B=(b1,b2,…,bn)T表示各网页的排名值,用Bi表示第i次迭代结果,用矩阵A=a11 … a1m … a1n… … … … …am1 … amm … amn… … … … …an1 … anm … ann表示网页之间的转移概率,其中amn表示第m个网页指向第n个网页的链接概率,那么可以用公式(2)表示网页排名情况。其中,Bi表示i时刻的网页排名情况,Bi-1表示前一时刻的网页排名情况。
在公式(2)经过数次迭代趋于收敛后,可以得到公式(3):
由于存在某些孤立网页不指向其他任何网页的特殊情况,转移矩阵A往往为稀疏矩阵。为了解决小概率事件下稀疏矩阵的运算问题,引入常数?琢进行平滑处理,得到公式(4)。其中N是互联网网页的数量,I是单位矩阵,?琢为介于0到1之间的常数,一般取0.15。
PageRank算法在数据挖掘与知识图谱中的研究和应用越来越多,尤其在社群识别(Community Identification)方面效果非常明显。商业银行在内部审计中可以运用PageRank算法,将审计关注对象作为网络中的节点,通过各种关联关系构建有向图,然后计算转移概率,再通过迭代,得到满足收敛条件的PR值,进而识别出可疑个体及其关联团体。
三、商业银行担保业务审计重点及存在困难
当前,国内外宏观经济发展处于下行期。商业银行为规避社会信用环境恶化风险,主动压降信用贷款,发展担保贷款加强风险补偿。在实践工作中,担保贷款管理不到位给银行信贷资产造成损失的案例层出不穷,成为商业银行内部审计必须关注的重点。
广义担保包括保证、质押和抵押等,是指商业银行通过改变信贷风险轮廓来影响借款人的违约损失率或违约概率,从而降低其信用风险。狭义担保特指保证,是指商业银行与保证人约定,如果借款人不履行债务,保证人将承担履行债务的责任[ 6 ]。担保的最大特点是以第三人的信用来实现债务履约。在本文中,担保特指狭义担保。 (一)银行担保审计关注重点
第一还款来源是指借款人从事生产经营及相关活动而产生的、直接用于归还银行贷款的款项。第二还款来源是指当借款人无法偿还银行贷款时,通过处置抵押物、质押物或者对担保人进行追索而得到的款项。担保属于第二还款来源,为借款人违约提供事后补偿机制。商业银行必须认识到担保作为补偿机制所存在的局限性,不能过于注重担保,而弱化对借款人第一还款来源的关注。商业银行内部审计在开展担保业务审计过程中,主要关注以下方面:
(1)保证人新增对外担保情况。保证人在为本行贷款提供担保后,又为其他借款人或当前借款人他行贷款提供担保,降低了原被担保债权的保障力度,增大了本行风险。
(2)保证人财产抵押情况。保证人财产对外抵押过多,通常表明保证人自身债务负担较重,一旦保证人违约,在有限债权处置完抵押物后,保证人就成为“空壳公司”,失去代偿能力。
(3)保证人在本行贷款情况。如果保证人在本行有大额贷款,一旦借款人违约,银行在是否追索保证人时往往面临两难境地。追索保证人可能导致其不能持续经营,并会危及本行对保证人贷款的安全。
(4)借新还旧涉及保证情况。借款合同双方当事人协议以新贷款偿还旧贷款,银行与原保证人必须重签保证合同,否则保证人不承担民事责任。
(5)互保和连环担保情况。互保和连环担保在实际操作中往往很难追偿。经济上行期,企业“抱团取暖”;经济下行期,风险扩散容易造成“火烧连营”,连环追索容易形成区域金融风险。
(6)集团母公司保证情况。重点考察集团母公司的自身经营情况、财务情况和资信情况,分析母公司的保证能力,不能以合并报表代替母公司报表。
(二)银行担保审计存在的困难
当前,商业银行内部审计数据分析基本基于Oracle、SQL Server、DB2等关系型数据库。传统方法在利用结构化查询语言(SQL)开发规则模型提取疑点的同时,也存在一些不足,主要表现在以下方面:
(1)传统关系型数据库采用笛卡尔积对数据进行搜索和匹配,在处理担保关系中涉及的多主体、多链条、多张表所面临的指数级上升的海量数据量时,存在制约瓶颈。
(2)传统关系型数据库支持选取(Select)、连接(Join)、分组汇总(Group by)、取唯一值(Unique)等算法,但是对于聚类、回归、决策树、支持向量机、神经网络等高阶算法,尤其是担保中经常涉及的有向图无能为力。
(3)传统关系型数据库以二维表的形式向审计人员呈现数据,无法以颜色、形状、大小等形式直观形象触达审计人员,需要审计人员具备较高的数据分析能力和思维抽象能力。
四、知识图谱技术应用的理论框架
构建知识图谱需要使用知识表示、图数据库、自然语言处理、机器学习等多种技术。审计人员通过构建知识图谱,可以提炼审计对象之间的关联关系组成关系网络,实现多角度机构或者人员画像,深度挖掘隐形关联,复现复杂审计场景。
(一)基于Neo4j图数据库的知识图谱实现
相对于传统的关系数据库,图数据库在处理大量的、复杂的、互连接程度高、低结构化程度低的数据方面具有优势,更便于实现基础的知识图谱功能。图数据库的基本元素为节点和边。边将有关联关系的节点链接,形成复杂网络拓扑。当在节点之间建立新的链接时,图数据库使用列表来实现直接访问,而不像传统关系数据库需要全表遍历搜索。
Neo4j图数据库是当前应用最广泛的图数据库软件,具有良好的高并发性和可扩展性,支持在一台计算机上处理数十亿个节点和边,并支持扩展到多台计算机同时运行,克服了传统关系型数据库在查询大量连接(join)关系时所出现的性能下降问题。但是默认情况下,Neo4j数据库以图的形式呈现所有的节点和关系,导致审计人员难以迅速聚焦到重点可疑样本。
(二)基于Python的知识图谱技术改进
PageRank算法于1996年由谷歌公司的Page和Brin提出,最初用于计算互联网网页重要程度。现在该算法已经成为复杂图分析的主要算法,属于机器学习中的无监督学习。PageRank算法在本质上是一阶有限离散马尔可夫链,其基本思想是在有向图上定义一个随机游走模型,呈现游走者沿图中有向边随机访问网络节点的行为。在满足一定假设条件的前提下,每个结点访问概率可以通过矩阵计算得到,即PageRank值或PR值。
Python语言的NetworkX库具有常用的复杂图和网络分析函数,可用于知识图谱的建模。使用NetworkX库的PageRank函数可以计算每个节点的PR值,使用NetworkX库的NetworkX weakly_connected_component_subgraphs函数可以把全图拆分成独立的子图。结合Python语言强大的计算能力和Neo4j图数据库强大的数据可视化呈现能力,审计人员可以灵活建模,并将PR值较高的疑点及其所有的显性或隐性担保关系进行直观呈现。
五、知识图谱技术在商业银行担保审计中的应用案例
(一)案例背景及审计思路
担保圈链内企业普遍存在融资杠杆率高、过度融资、多头授信以及对外投资房地产、股票等现象。如果个别企业发生银行履约问题,将会造成多米诺骨牌效应,最终导致圈链内所有企业受到影响。目前,担保圈链风险化解压力大,出险率较高,而部分商业银行分支机构对担保风险传导预判不足,对客户贷前调查不深入,对担保企业代偿能力分析不到位。出险前对关联关系、客户特征、多头或过度授信等风险揭示不充分,对其他银行收贷、担保代偿等情况反应滞后;出险后对借款企业担保圈链的復杂关系梳理不够清晰,对企业和实际控制人名下资产状况、对外投资信息掌握不够全面,未能有效把握化解风险的最佳时机。 (二)知识图谱技术实现途径
本文结合当下流行的开源语言Python和开源图数据库Neo4j实现了担保圈链的知识图谱,并直观展现了疑点数据。思路和步骤如图1所示。
1.数据提取
在内部审计数据分析系统中,提取担保关系表、客户信息表、资金流向表。客户信息表中含有客户的编号和名称信息,担保关系表含有担保客户编号、被担保客户编号、担保金额、担保日期等信息,资金流向表含有客户编号、客户账号、交易日期、交易金额、借贷方向、交易余额、交易对手账号、交易对手名称等信息。
2.数据清理
将信息不全的客户进行剔除,并且根据需要区分出担保关系是否已经到期。由于数据治理或历史问题,难免会有脏数据,审计人员需要对数据进行必要的清理。鉴于部分审计场景只需关注担保关系尚未结束的客户,故在此对担保关系现状进行标识。
3.数据加载和加工
Python语言的Pandas库纳入了标准数据的处理函数,可以高效地操作大型数据集。使用其中的read_X函数可以读取CSV、Excel、sql、json、html、stata等多种格式的数据。Python语言中的NetworkX库具有创建和操作复杂网络的功能,使用其中的DiGraph函数创建全网有向图。
4.子图计算
使用Python语言NetworkX库的PageRank函数,可以计算节点的重要程度(PR值);使用Python语言NetworkX库的weakly_connected_component_subgraphs函数,可以将全网拆分成不连通的子网络。两者相结合,可以将PR值高的节点所在的子网从全网中进行逐一剥离。
5.数据展现
Py2neo是一个用于从Python应用程序内部调用和处理Neo4j数据库的工具包。通过Py2neo包的Node函数在Neo4j数据库中生成包含客户信息的节点,通过Relationhan函数在Neo4j数据库中生成客户之间担保的链接、客户之间资金流向的链接。之后,Neo4j数据库即以图形化方式展现疑点数据集合。
6.现场排查
审计人员根据Python的PR值获取聚合度高的可疑节点,再通过Neo4j数据库获取相应的担保关系和资金流向关系图。审计人员结合审计线索和可视化数据,锁定重点样本后,到审计现场通过访谈、调阅、走访观察等手段进行排查和确认。数据展现效果如图2所示。
7.报告呈现
审计人员根据现场检查发现问题,对被审计对象的战略执行、企业治理、经营情况等方面進行评价,并编制成内容客观、逻辑清晰、结论明确、建议合理、重点突出的审计报告呈现给主管领导,促进企业加强问题整改、完善内部控制,必要时对责任人进行追责处理,进而使内部审计部门为企业实现“管理增值”的目标。
(三)审计发现问题
L地区曾属于国家大型钢木和家具生产基地,主要经济由钢铁冶炼及压延、木材加工、家具生产及销售等产业支撑。但是,根据国家后续规划政策,该地区属于环境治理核心区域,钢铁冶炼生产必须退出,金属加工、焊接喷漆等家具制造环节严格限制性生产。当地钢铁冶炼企业已全部停产,钢铁压延及金属加工企业多数关停,家具生产企业受制于环保及原材料异地采购成本已呈现颓势,风险爆发显示出集中性和传染性。各金融机构已对当地融资环境负面评价,抽贷情况严重,授信风险呈连锁反应。
为分析和揭示上述问题,审计组通过知识图谱模型获取疑点数据并经过现场查证后发现,L地区部分借款企业循环互保,且隶属于同一生产链并互为交易对手,对外融资主要风险缓释手段为担保,融资代偿能力不足,循环担保变为事实上的信用贷款,在区域环保治理及融资环境逐渐严峻的背景下,产业链风险波动从上游向下游顺向扩大传导,大量企业关停,生产链及资金链断裂,担保圈风险逐渐暴露。如B县X建材有限公司、L市X木业有限公司、B县X金属制品有限公司、B县X制管有限公司、H省X金属制品有限公司、H省X化工集团有限公司、W县X能源有限公司、H省X建材有限公司、L市X石油天然气销售有限公司、B县Y制管有限公司10户借款人与L市Z家具股份有限公司及其关联公司同属于当地钢木家具生产链企业,彼此既互为上下游客户,又互为循环担保人,生产链条和资金链条高度相关,物流、资金流、信息流环环相扣,融资环境系统化风险明显。上述10户借款人授信余额10.62亿元,占L区域全部授信客户户数及授信余额的35.71%和14.83%,其中关注类及以下客户7户,授信余额8.42亿元,分别占非关联企业担保授信客户户数及授信余额的70%和79.28%。
(四)整改建议
针对审计发现问题,总行领导高度重视,做出重要批示。业务主管部门举一反三,第一时间在全行范围内进行了梳理和排查,并制定出整改安排,有效避免了担保风险的扩大和集中爆发。具体整改措施包括:(1)在贷前调查阶段,除详细分析企业融资情况外,加强对“或有负债”成因分析,确认是否存在圈保、链保行为,对涉及担保圈链的客户授信准入严格把关;(2)重新评估分析保证担保的风险缓释作用,审慎将保证担保作为唯一风险缓释手段,尤其针对民营企业,必须增加其他风险缓释手段;(3)加强贷后管理,关注借款人或有负债变化情况,及时确认新增授信是否存在担保圈链情况。
六、总结及展望
随着新技术、新理念、新方法日新月异的发展,信息技术在商业银行内部审计中将发挥越来越重要的作用。本文结合项目实践,探索了知识图谱技术、PageRank算法在商业银行担保业务审计中的应用。上述模型的思路、工具和方法在其他涉及处理复杂网络的内部审计中具有通用性和参考性。
Python语言和Neo4j图数据库均为开源软件,使用成本较低,适合具有探索和创新精神的内部审计人员进行尝试。但是Python语言和Neo4j图数据库两者的组合应用尚不多见,且编程开发和软件使用有一定的应用门槛。在建模过程中,存在熟悉业务的审计人员不熟悉建模工具,熟悉软件工具的审计人员可能不熟悉业务思路,复合型人才缺失、团队需要磨合、模型反复沟通迭代的情况。
党的十九大报告中指出审计要“善于运用互联网技术信息化手段开展工作”,审计署提出审计工作人员需成为“新时代的数字化审计兵”。随着数字化转型的发展,部分商业银行已将人工智能、大数据等科技手段应用于日常审计工作中,并且更加重视复合型审计队伍的建设、多维度数据的引入、高性能数据分析平台的建设,相信知识图谱等新技术将会在内部审计中发挥越来越重要的作用。
【主要参考文献】
[1] 牛艳芳,薛岩,邓雪梅,等.审计大数据关联的网络分析平台构建及应用研究[J].审计研究,2018(5):35-42.
[2] 陈伟,居江宁.基于大数据可视化技术的审计线索特征挖掘方法研究[J].审计研究,2018(1):16-21.
[3] MING LI,XIUZHI LU,LISHENG CHEN,et al.Knowledge map construction for question and answer archives[J].Expert Systems With Applications,2020,141(1).
[4] SOYEOP YOO,OKRAN JEONG.Automating the expansion of a knowledge graph[J].Expert Systems With Applications,2020,141(1).
[5] 张芸芸,方勇,黄诚.基于Neo4j图谱的信用卡欺诈检测[J].信息与电脑(理论版),2018(21):28-30.
[6] 邝思敏.中国银行T分行中小企业信贷风险控制模式研究[D].湘潭:湘潭大学硕士学位论文,2018.