红队测试
Red Teaming
在产品发布前故意发起攻击的角色——「自己先攻破自己」已成为AI安全的标准流程。
简单来说
指在产品发布前故意对其发起攻击的角色,或这项活动本身。这个说法源自军事演习:模拟敌军(红队)攻击己方部队(蓝队)。后来这一做法进入安全行业,如今已成为AI领域的标准流程。
新模型发布前,数百人会想方设法测试它——尝试越狱、诱导危险回答、挖出偏见,测试结果会写进模型卡。「经过外部红队数月验证」这样的说法,已成为发布公告中建立信任的常用手法。多国政府的监管规定也在把红队测试列为前沿模型的强制要求。
相关词条
出现过这个词的报道
目前还没有报道用到这个词。有新报道时会自动出现在这里。