• 最近访问:
发表于 2026-09-14 23:31:30 股吧网页版
让大模型“边生成边识别”风险,蚂蚁开源大模型“安全护栏”
来源:大河财立方

  【大河财立方记者陈薇】9月14日,蚂蚁集团AI安全实验室发布并开源大模型内生式安全护栏SingProbe。与主流的独立外挂审核模型不同,SingProbe复用基座模型推理过程中的隐藏状态,通过轻量探针在生成过程中逐token实时输出风险信号,额外开销不足0.5%,相关代码与模型已同步开源。

  当前大模型安全护栏普遍采用外挂架构,在模型前后部署独立审核模块,对用户输入和模型输出各做一次完整推理。

  这种方式代价是双倍计算成本,若等完整回答生成后再检查,风险内容可能已经被用户看到。而且外挂护栏模型,容量通常远小于基座模型,面对复杂内容时存在理解能力不匹配的问题,纠错可能会不准确。

  SingProbe则直接读取大模型内部已产生的隐藏态,由仅数百万参数的轻量探针同步完成查询意图分类、内容安全与幻觉风险判定,实现“边生成边识别”,在风险内容完整输出前即可介入拦截。

  从当下的技术路线看,外挂式仍是行业绝对主流,绿盟、百度、阿里、保旺达等国内厂商的安全护栏,以及国际上的Llama Guard 3、ShieldGemma等,均采用此架构。内生式则是近一年的新方向,学术界已有探索,但SingProbe是目前首个由大型科技公司开源、适配29个主流模型的完整方案。

  值得注意的是,蚂蚁正加速布局医疗大模型等高风险场景。在健康咨询、用药建议等领域,模型输出的准确性与安全性直接关系到用户人身安全,对实时风险监测的需求尤为迫切。SingProbe的token级流式检测能力,恰好能在医疗问答生成过程中持续评估风险,及时阻断不当内容。

郑重声明:用户在财富号/股吧/博客等社区发表的所有信息(包括但不限于文字、视频、音频、数据及图表)仅代表个人观点,与本网站立场无关,不对您构成任何投资建议,据此操作风险自担。请勿相信代客理财、免费荐股和炒股培训等宣传内容,远离非法证券活动。请勿添加发言用户的手机号码、公众号、微博、微信及QQ等信息,谨防上当受骗!
作者:您目前是匿名发表   登录 | 5秒注册 作者:,欢迎留言 退出发表新主题
温馨提示: 1.根据《证券法》规定,禁止编造、传播虚假信息或者误导性信息,扰乱证券市场;2.用户在本社区发表的所有资料、言论等仅代表个人观点,与本网站立场无关,不对您构成任何投资建议。用户应基于自己的独立判断,自行决定证券投资并承担相应风险。《东方财富社区管理规定》

扫一扫下载APP

扫一扫下载APP
信息网络传播视听节目许可证:0908328号 经营证券期货业务许可证编号:913101046312860336 违法和不良信息举报:021-34289898 举报邮箱:jubao@eastmoney.com
沪ICP证:沪B2-20070217 网站备案号:沪ICP备05006054号-11 沪公网安备 31010402000120号 版权所有:东方财富网 意见与建议:021-54509966/952500