Abstract
随着人工智能系统能力持续增强,非国家行为体滥用该技术制造极端威胁——尤其是化学、生物、放射性与核(CBRN)武器及大规模网络攻击——的潜在风险,已引起各国政府、企业界、学术界和公众的高度警觉。
本报告从三个层面梳理了目前五类主要防护实践:两个模型层面的干预措施——预训练数据过滤和后训练技术;两个部署层面的干预措施——监测和访问控制;以及一个治理层面的干预措施——部署前评估。部署前评估可以为部署决策提供依据,包括模型发布条件和防护措施设计,并支持模型部署之后对相关措施进行持续改进。对于每一类干预措施,我们都会介绍当前实践、前沿模型开发者的实施情况、实证证据、局限性,以及未来研究与协作的优先方向。