K-文化的一切——从回归到 K-美妆,发送到您的邮箱订阅邮件

METAL MEDIA

K-文化术语词典安全与争议

护栏机制

Guardrails

泛指防止AI给出危险回答或采取危险行为的各种安全装置。

简单来说

护栏机制是一个统称,指的是防止AI偏向危险方向的各种安全装置——就像公路上的护栏一样。训练模型拒绝危险请求、检查输入输出的过滤器、限制智能体行动范围,这些都属于护栏机制。

这个说法在企业引入AI的报道中尤其常见——「配备护栏机制的内部聊天机器人」意味着已经设置了防护装置,让它不会泄露公司机密,也不会做权限之外的事。但如果收得太紧,就会出现连正常问题都被拒答的「过度拒绝」现象,因此收紧的尺度始终是争论的焦点。

相关词条

出现过这个词的报道

目前还没有报道用到这个词。有新报道时会自动出现在这里。

浏览全部词条