INSIGHTS · 系列 01 / 04

精算视角下,健康行为数据
到底"资产"在哪里

"数据资产化"这个词最近被讲得太多。作为精算负责人,你真正要判断的其实只有四件事:相关性、边际信息量、可解释性、稳定性。本文把这四件事各自的判断标准写清楚,并给出可以带回内部做检查的问题清单。

2026-07-13 · 陈玥 / 首席分析师 · 约 12 分钟阅读

一、精算团队关心的不是"资产",是"可用"

科技公司喜欢用"数据资产"这个词,大多数时候讲的是估值、交易、变现。精算团队关心的是另外一个词:可用性。一份数据能不能进你的定价因子体系、能不能通过监管报备、能不能在下一轮费率调整时经得起复盘,才是它对精算团队的"资产价值"。这一段翻译不做,后面所有讨论都会跑偏。

下面四个小节,分别拆解精算团队判断"这份数据能不能进模型"的四个维度。

二、维度一:相关性,但不是简单相关性

看到"健康分和赔付率相关系数 0.42"这种数字,不能直接下结论。精算团队真正要问的是三层问题:

能同时通过这三层的相关性,才可以进定价模型的候选池。

三、维度二:边际信息量,不是"加进去有效",而是"加进去有多大效"

精算模型里最难说服业务部门的一句话是:"这个特征加进去,AUC 从 0.71 升到 0.72"。0.01 的提升值不值得动一次费率报备?判断依据是把 AUC 换算成保费影响。

示例(仅示意,非线上真实数据):AUC 从 0.71 到 0.72 大约对应赔付预测方差降低 3%,对一款年保费 1200 元、赔付率 78% 的百万医疗产品,理论上给出的费率调整空间约为 22 元/年/单。如果承保规模 100 万单,理论年化影响约 2200 万元。这个量级值得动一次报备。0.005 以下的提升,通常不值得。

建议在评估任何新数据源(不只是健康行为数据)时,和你的数据供应商约定一个"边际 AUC 阈值",低于该阈值不进入定价链路,只做营销分层用。

四、维度三:可解释性,要能过监管报备,也要能过再保尽调

模型的可解释性,在两个场景下会被严格审视:向监管报备费率变更时、再保公司做费率尽调时。这两个场景的读者不是数据科学家,而是精算 + 法务 + 风险管理组合。所以"SHAP 输出前 40 个特征"是不够的。VITA 建议的做法是把 SHAP 输出重构为 5 个业务因子桶:

  1. 身体活动(步数、运动时长、心率变异性)
  2. 睡眠与恢复(总时长、深睡比、规律性)
  3. 基础指标(BMI、血压、静息心率)
  4. 依从性(体检参与、慢病管理执行、复诊到访)
  5. 行为一致性(周内规律性、季节性稳定度)

每个桶给一个业务化的中文名 + 一段监管友好的解释文本,并且预留一个"申诉字段":当具体用户对定价结果有异议时,可以逐桶展开该用户的相对位置。这是过监管、过再保、过用户投诉的三重防线。

五、维度四:稳定性,包括模型稳定与采集稳定

稳定性有两个层次:

六、精算负责人自查清单

在决定"要不要把某个新数据源接进定价模型"之前,建议把下面 8 个问题挨个回答一遍:

  1. 剥离基础人口学因子后,残差相关性还够吗?
  2. 相关性的单调方向和精算直觉一致吗?
  3. 边际 AUC 提升折算到保费上,值得动一次报备吗?
  4. SHAP 输出能不能收敛到 5 个可解释的业务因子桶?
  5. 模型重训前后 P95 差异能不能控在阈值内?
  6. 数据采集有降级方案吗?供应商断线怎么办?
  7. 缺失字段有没有可控的"缺失即信号"处理?
  8. 你能给这份数据配一份 15 页以内的"模型说明书"吗?

回答不了任何一个,就先别接。真正的资产是"能被审计的"数据,不是"看起来相关"的数据。

本文的观点基于 VITA 与多家保司精算团队的沟通共识,以及公开学术研究结论,仅供内部判断参考,不构成任何精算建议。VITA 不面向个人投资者,不承诺任何金融收益。

← 返回洞察专题 下一篇:CIO 视角 · VC/DID 技术栈 →