大数据技术在民生贷款系统运维的应用实践

图灵汇官网

随着大数据和人工智能技术的不断发展,它们在各个领域的应用越来越广泛,未来有可能成为一项基础能力和服务。然而,技术的根本目的是解决问题,因此如何结合运维领域的特点,充分利用大数据技术的优势和潜力,解决运维问题,成为了运维人员面临的重要挑战。

本文尝试探讨这一问题,并希望能提供一些初步的思路和方法。

一、问题背景

贷款交易链

一笔贷款从发放到结清的过程中,每一笔交易都密切相关。如果早期的交易数据有误,后续交易基于这些数据进行时,错误就会被放大。因此,贷款的贷后交易记录可以视为一个栈,其中最早的交易位于栈底,最新的交易位于栈顶。一旦发现问题,就需要从最新交易开始逐笔追溯,直至找到问题所在。

贷款复杂性

贷款数据模型非常复杂,以一笔借据为核心,与客户、账户、额度、押品、档案、账务等多个业务领域相连。一笔典型的贷款数据需要数百个字段来描述。此外,贷款交易链较长,涉及多个系统,账务处理也较为复杂,特别是在涉及特殊交易时(如资产证券化、不良资产转让)。

分布式架构带来的挑战

分布式架构虽然带来了诸多优势,但在运维方面却带来了更多的挑战。例如,在分布式架构下,数据分散在多个数据库中,这给后台运维带来了不小的困难。一方面,从管理单一数据库转变为管理多个数据库;另一方面,查询数据时需要先确定数据的位置,跨库查询和合并查询效率较低,容易对生产库造成不必要的压力。

为了解决这些问题,可以采取两种方法: 1. 将常用运维需求工具化,形成专用的运维模块,通过与业务应用相同的方式访问数据,但涉及大量数据的复杂查询仍存在风险。 2. 利用大数据技术手段,例如通过每日日终抽取全量数据或将实时数据处理技术引入,实现运维功能。关键是要将运维场景与生产库解耦,同时充分发挥大数据技术的优势,应对海量数据和复杂查询。

二、应用场景

批扣结果检查及衍生场景

批量扣款是贷款系统中重要的批处理作业。每天处理数十万甚至上百万笔借据,确保每笔交易的准确性至关重要。为此,设计了批扣结果检查功能,通过大数据平台按照业务逻辑处理数据,对比实际扣款结果,从而发现漏扣、不足额扣款等问题,帮助运维人员及时干预,提升客户体验。

实时业务监控

银行的运维监控体系不断完善,涵盖从基础环境到应用探活等多个层面。在此基础上,增加了业务场景监控,利用实时流计算技术,实时采集应用日志,通过全局唯一标识符将不同系统中的应用日志关联起来,形成交易链条,供问题分析使用。该功能不仅丰富了监控维度,还提升了运维人员对系统的全面了解,为进一步提高系统运维水平奠定了基础。

数据质量巡检

应用异常和代码缺陷通常会导致业务数据出现问题,如果不加以干预,这些问题会一直潜伏在系统中,最终导致客户投诉和运维压力增大。为此,设计了数据质量巡检功能,每日日终将数据抽取至下游大数据平台,检查数据的一致性和完整性,并将需要关注的数据存储在HBase中。通过这种方式,可以提前发现潜在问题,避免大规模数据差错。

征信报送数据预估

银行需要向人行准确报送每笔贷款的征信信息。贷款系统虽不是直接责任系统,但可以通过预估数据量,与实际报送量进行比对,防止大规模数据差错。这种预估机制有助于保障数据的准确性和一致性。

三、展示及通知

上述功能涉及的通知和告警需求统一纳入零售资产板块的异常处理框架,由运维主导设计并落地在iLoan及RCS系统中。该框架整合了多种通知渠道,包括泰岳系统、邮件和业务待办任务,实现了问题从发现到处理的完整流程。

最后,特别感谢开发人员的努力和支持,包括陈深龙的贷款团队、罗京的DC团队和王开煊的ROD团队。他们的贡献不仅体现在本文所涉及的功能上,还包括许多非功能性需求的实现,充分体现了民生科技开发人员对安全生产的重视和对客户负责的态度。

编辑:民生运维文化建设团队
作者:张新亮

本文来源: 图灵汇 文章作者: 徐菲