护栏机制
Guardrails
泛指防止AI给出危险回答或采取危险行为的各种安全装置。
简单来说
护栏机制是一个统称,指的是防止AI偏向危险方向的各种安全装置——就像公路上的护栏一样。训练模型拒绝危险请求、检查输入输出的过滤器、限制智能体行动范围,这些都属于护栏机制。
这个说法在企业引入AI的报道中尤其常见——「配备护栏机制的内部聊天机器人」意味着已经设置了防护装置,让它不会泄露公司机密,也不会做权限之外的事。但如果收得太紧,就会出现连正常问题都被拒答的「过度拒绝」现象,因此收紧的尺度始终是争论的焦点。
相关词条
出现过这个词的报道
目前还没有报道用到这个词。有新报道时会自动出现在这里。