从“看起来很强”到“真正能治病”——浅析原因与解决路径
演示模式:键盘左右键翻页 / 按 F 全屏
一个病人可能有数万维特征,但罕见病样本往往只有几十或几百例。
模型很容易“找出训练集中极小差异”,但这些差异未必稳定。
病历记录、随访缺失、人工判读误差都会导致标签偏差。
AI 可能把病历中“笔误”误学成强规则。
不同医院设备、拍片参数、人口结构不同,导致模型记住“医院风格”而不是“病理规律”。
把训练样本理解成“发烧+咳嗽+穿红衣服 = 感冒”时,模型会寻找“红衣服”这个看起来强相关但其实无效的模式。
训练集
真实场景
正则化
让模型不要过度自信
Dropout
随机休息,减少依赖单一特征
数据增强
变形训练,增强泛化
交叉验证
看它是否“真会”
外部验证
跨医院真实考核
正则化的核心思想:给复杂模型“纪律”,不要让权重无限变大。
| 方法 | 作用 | 适用场景 |
|---|---|---|
| L1 | 特征选择 | 基因/临床指标筛选 |
| L2 | 稳定权重 | 回归/神经网络 |
| Elastic Net | 兼顾稀疏与稳定 | 医学高维数据 |
Dropout在训练时随机“关闭”部分神经元,防止模型对单个特征过度依赖。
Early Stopping在验证集误差开始上升时提前停止训练,防止模型继续“记住噪声”。
影像增强
文本增强
核心价值
| 评估方式 | 目的 | 价值 |
|---|---|---|
| 内部验证 | 调参/筛选模型 | 快速迭代 |
| 交叉验证 | 评估稳定性 | 降低偶然误判 |
| 外部验证 | 真实部署能力 | 更接近临床落地 |
高维数据
噪声标签
多中心差异
样本不足
Q & A