从100个生成式AI产品中汲取的教训
时间:2025-03-18
作者:布莱克·布拉文克尔,阿曼达·明尼奇,希文·查瓦拉,加里·洛佩斯,马丁·普鲁伊奥,惠特尼·马克斯韦尔,乔里斯·德格鲁伊特,凯瑟琳·普拉特,萨菲尔·齐,尼娜·奇卡诺夫,罗曼·卢茨,拉贾·谢卡尔·拉奥·德希康达,博勒-埃尔登·雅达尔多奇,尤金尼亚·金,贾斯汀·宋,基根·海因斯,丹尼尔·琼斯,乔治奥·塞维里,理查德·伦登,山姆·沃恩,维多利亚·韦斯特霍夫,皮特·布莱恩,拉姆·尚卡尔·西瓦·库马尔,约纳坦·宗格,长谷川昌,马克·拉辛维茨
近年来,AI红队测试已成为一项用于探测生成人工智能系统安全性和稳健性的实践。鉴于该领域的初创性质,关于如何实施红队测试还有许多未解之谜。基于我们在微软针对超过100个生成人工智能产品的红队测试经验,我们提出了我们的内部威胁模型本体论以及我们汲取的八个主要经验教训: 1.了解系统能够做什么以及其应用领域 您不需要计算梯度来破坏一个人工智能系统。 3.AI红队对抗并不是安全基准测试。自动化可以帮助覆盖更多的风险领域。 5.人工智能红队测试中的人为因素至关重要。 6.负责任的AI危害普遍存在,但难以衡量 7.大型语言模型(LLMs)放大了现有的安全风险并引入了新的风险 8.确保人工智能系统的任务永远不会完成。 通过与我们的运营案例研究分享这些见解,我们提供了旨在将红队工作与实际世界风险对齐的实用建议。我们还强调了我们认为常常被误解的AI红队方面,并讨论了该领域需要考虑的开放性问题。