"数据资产化"这个词最近被讲得太多。作为精算负责人,你真正要判断的其实只有四件事:相关性、边际信息量、可解释性、稳定性。本文把这四件事各自的判断标准写清楚,并给出可以带回内部做检查的问题清单。
2026-07-13 · 陈玥 / 首席分析师 · 约 12 分钟阅读
科技公司喜欢用"数据资产"这个词,大多数时候讲的是估值、交易、变现。精算团队关心的是另外一个词:可用性。一份数据能不能进你的定价因子体系、能不能通过监管报备、能不能在下一轮费率调整时经得起复盘,才是它对精算团队的"资产价值"。这一段翻译不做,后面所有讨论都会跑偏。
下面四个小节,分别拆解精算团队判断"这份数据能不能进模型"的四个维度。
看到"健康分和赔付率相关系数 0.42"这种数字,不能直接下结论。精算团队真正要问的是三层问题:
能同时通过这三层的相关性,才可以进定价模型的候选池。
精算模型里最难说服业务部门的一句话是:"这个特征加进去,AUC 从 0.71 升到 0.72"。0.01 的提升值不值得动一次费率报备?判断依据是把 AUC 换算成保费影响。
示例(仅示意,非线上真实数据):AUC 从 0.71 到 0.72 大约对应赔付预测方差降低 3%,对一款年保费 1200 元、赔付率 78% 的百万医疗产品,理论上给出的费率调整空间约为 22 元/年/单。如果承保规模 100 万单,理论年化影响约 2200 万元。这个量级值得动一次报备。0.005 以下的提升,通常不值得。
建议在评估任何新数据源(不只是健康行为数据)时,和你的数据供应商约定一个"边际 AUC 阈值",低于该阈值不进入定价链路,只做营销分层用。
模型的可解释性,在两个场景下会被严格审视:向监管报备费率变更时、再保公司做费率尽调时。这两个场景的读者不是数据科学家,而是精算 + 法务 + 风险管理组合。所以"SHAP 输出前 40 个特征"是不够的。VITA 建议的做法是把 SHAP 输出重构为 5 个业务因子桶:
每个桶给一个业务化的中文名 + 一段监管友好的解释文本,并且预留一个"申诉字段":当具体用户对定价结果有异议时,可以逐桶展开该用户的相对位置。这是过监管、过再保、过用户投诉的三重防线。
稳定性有两个层次:
在决定"要不要把某个新数据源接进定价模型"之前,建议把下面 8 个问题挨个回答一遍:
回答不了任何一个,就先别接。真正的资产是"能被审计的"数据,不是"看起来相关"的数据。
本文的观点基于 VITA 与多家保司精算团队的沟通共识,以及公开学术研究结论,仅供内部判断参考,不构成任何精算建议。VITA 不面向个人投资者,不承诺任何金融收益。