人工智能在无人干预的条件下开展漏洞修复,往往无法彻底消除软件安全缺陷。

1Password 旗下 Off‑by‑1 实验室的研究人员针对主流大模型开展安全补丁测试,选取 ChatGPT 5.5 中等输出强度与 Claude Opus 4.8 高输出强度两套模型,对安全补丁生成效果进行评估。结果显示,完全由 AI 自主生成的补丁,能够干净彻底修复漏洞的概率仅约四成不到,大部分补丁要么无法根除安全隐患,要么在修改代码过程中衍生出新问题。

1Password 安全研究主管基思・胡德莱特在博客中指出,这项实验印证,依靠大语言模型完成安全漏洞修复,离不开人工复核环节。研究选取 6 个已公开的通用漏洞披露案例,借助两款具备网络安全推理能力的前沿大模型,累计生成 6080 份补丁。统计表明,既彻底消除漏洞、又不改变程序原有运行逻辑的补丁,平均成功率仅有 26%。

细分数据显示,20.1% 的补丁虽解决原有漏洞,却篡改业务逻辑,例如把白名单机制直接替换为黑名单;2.3% 的补丁修复旧漏洞的同时埋下新安全风险;49.3% 无法阻断部分攻击路径;另有 2.2% 既没能修复漏洞,还新增可被利用的攻击点。就算是有效修复的两类补丁,超三分之一都属于脆弱修复:代码看似规避特定攻击,比如过滤部分输入字符,却没有触及漏洞产生的根源。

研究团队将这类大模型产出物命名为 FLAWED,即 “暗藏缺陷的类修复产物”。论文给出结论,完全由大模型生成、不经人工审核的补丁,整体收益显著为负。

补丁质量很大程度受初始提示信息影响。人类开发者和大模型处理漏洞都需要基础指引,但大模型更容易被错误信息带偏。在准确指引下,模型修复成功率可达 65%;无指引时下降至 50.4%;一旦输入错误指导,成功率直接跌落至 15.2%。人类工程师研读漏洞代码时,大多能够甄别误导信息,这是 AI 尚不具备的能力。

研究团队已开源 FLAWED 补丁评估工具,可供企业测评安全修复方案的实际效果。单看直接成本,AI 补丁确实具备优势,计入失败尝试开销,一份合格补丁平均成本仅 6.74 美元,远低于人力成本。但企业做成本收益测算时,不能只看直接开销,还必须把安全专家审核、校验 AI 输出的人力成本纳入考量,只有搭配充足人工监督,大模型辅助漏洞修复才有实际落地价值。