📚 Wiki 知识库

🏷️ 模型安全

1 篇

250个文档即可投毒大模型:数据投毒的规模与防御

Anthropic等机构的联合研究证实,仅需250个精心设计的恶意文档即可在6亿至130亿参数的大模型中植入永久后门。这种数据投毒具有隐蔽性、不可逆性和规模不变性,且目前缺乏有效的防御手段。作者认为这证实了基于公网数据抓取的训练范式存在根本性缺陷,呼吁转向使用离线、人工 curated 的高质量数据源(如1970年以前的文献)进行训练,并强调构建本地化、主权级模型的重要性。

技术网络安全 ✍ Brian Roemmele🕐 2026-04-21