跳转至

AB测试

一般贷后部门会从外部引入AI催收机器人服务(SaaS平台或者私有化部署),并采用分案的方式将逾期天数以及逾期金额小的案件分配给机器人催收。随着大模型技术的不断发展与成熟,研发催收机器人的门槛越来越低,不少企业都内部孵化了自研AI催收机器人的项目。

自研AI催收机器人开发完成后,交付的初版模型的能力大概率是差强人意的。针对这一问题, 本篇文章重点介绍下,如何在项目正式上线前通过几轮业务测试来暴露出模型的潜在问题,以及开启真实线上测试的注意事项。

1. 测试方案

自研 AI 催收机器人的测试可分为两个阶段:

  1. 内部运营自测:
  2. 一线坐席测试:

1.1 内部运营自测

1.2 一线坐席测试

经历过内部运营自测后,模型的能力已经有了初步的验证,按照我们罗列的点,但仍然存在一些潜在问题没有暴露出来。为了进一步验证模型的能力,需要将模型交付给一线坐席进行测试。

2. 放量计划

开启线上真实测试后,需要根据实际的回收效果,不断调整测试灰度。一方面在模型线上出现重大问题后,通过降低灰度减少损失;另一方面在模型线上表现优异后,通过提升灰度加速模型的迭代。

例如,初始给到自研AI的灰度为 10%,通过周监控自研与厂商的回收率差异,进行如下灰度调整:

  1. 如果绝对差值范围 1 ~ 2%,下一阶段按 30% 灰度。
  2. 如果绝对差值范围 0 ~ 1%,下一阶段按 20% 灰度。
  3. 如果绝对差值范围 -1 ~ 0%,下一阶段按 10% 灰度。
  4. 如果绝对差值范围 -2 ~ -1 %,下一阶段按 5% 灰度。

3. 评价指标

相当于引入一个外部产商