Skip to content
象信控制台
实操

大模型护栏

用公开中文安全数据集的 850 条消息做测试:大模型应用的入口和出口各发一次象信请求,阈值写在代码里。strict 策略下,风险请求与攻击的标记率为 78.5%(不含角色扮演组为 89.0%),150 条普通请求无一误报;风险回复拦截 81.7%,220 条正常回复只误拦 2 条。