防范人工智能极端滥用的技术防护措施:当前格局与未来方向

Words by: Isabella Duan, Edward Kembery, Stephen Casper, Zhikai Chen, Jasper Götting, Geng Hong, Zaheed Kara, Lijun Li, Xiaojian Li, Kellin Pelrine, Ziyue Wang, Jia Xu, Ziwei Xu, Zhiyuan Zeng, James Zhang, Jie Zhang, Zilan Qian

Abstract

随着人工智能系统能力持续增强,非国家行为体滥用该技术制造极端威胁——尤其是化学、生物、放射性与核(CBRN)武器及大规模网络攻击——的潜在风险,已引起各国政府、企业界、学术界和公众的高度警觉。   本报告从三个层面梳理了目前五类主要防护实践:两个模型层面的干预措施——预训练数据过滤和后训练技术;两个部署层面的干预措施——监测和访问控制;以及一个治理层面的干预措施——部署前评估。部署前评估可以为部署决策提供依据,包括模型发布条件和防护措施设计,并支持模型部署之后对相关措施进行持续改进。对于每一类干预措施,我们都会介绍当前实践、前沿模型开发者的实施情况、实证证据、局限性,以及未来研究与协作的优先方向。

Authors

Isabella Duan, Edward Kembery, Stephen Casper, Zhikai Chen, Jasper Götting, Geng Hong, Zaheed Kara, Lijun Li, Xiaojian Li, Kellin Pelrine, Ziyue Wang, Jia Xu, Ziwei Xu, Zhiyuan Zeng, James Zhang, Jie Zhang, Zilan Qian