医疗人工智能的Harness Engineering:面向安全、可控与合规的大模型系统工程(六)

第六章 多层护栏与安全控制器:纵深防御的运行时屏障

6.1 引言:生成式 AI 在医疗中的不可消除风险与纵深防御哲学

大语言模型的输出空间在数学上是不可穷举的,这意味着无论投入多少数据进行对齐微调,无论是 RLHF 还是 DPO,都无法从理论上保证模型在受到对抗性输入或遇到分布外查询时不会产生危险输出。在医疗领域,一个看似无害的提示词组合就可能诱发模型编造不存在的药物适应症、忽略绝对的禁忌症,或者在缺乏足够信息的情况下给出确定性的诊断。OpenAI 的 GPT-4 系统卡、Google 的 Med-PaLM 2 技术报告都坦率承认,幻觉与过度自信仍然是基础模型无法根除的固有缺陷。这并非工程疏忽,而是统计语言模型的本质属性——它们学习的是分布,而非事实。

因此,医疗 AI 的安全保证不能寄托在“模型足够好就不会犯错”的假设上。正确的防御策略是纵深防御(Defense in Depth):在模型的输入端、推理前、输出端、甚至输出已被展示给用户之后,部署多层独立的安全机制。每一层都假设外层的防御可能被突破,因而具备独立的检测逻辑和阻断能力。正如核电站的反应堆有多重独立的安全壳,医疗 AI 也需要多重护栏(Guardrails)与一个独立的安全控制器(Safety Controller),才能将剩余风险降低到可接受的水平。

Rust 在此扮演的角色是使每一层护栏自身都是可信的