数分钟内,Meta与谷歌旗下 AI 模型安全防护机制遭破解移除
时间:2026-05-26 | 作者: | 阅读:0多款软件工具可去除Meta、谷歌等企业人工智能模型的安全防护机制,目前已有数千个篡改版本问世,原生管控约束均被剔除。
记者借助代码平台 GitHub 上的异端工具,在无专业硬件加持的情况下,不到十分钟就破除了Meta llama 3.3 模型的安全防线。
原版模型拒绝作答的违规问题,篡改版本均可回应。
此番曝光进一步引发监管机构与人工智能企业的担忧:随着开源模型性能愈发强大,研发方设置的安全防护将愈发难以维系。
芝加哥大学布斯商学院人工智能应用方向助理教授卡温埃塔亚贾夫表示:“以往只有专业资深人员才能破解安全防护,如今普通用户也能轻松做到。”
研究人员称,顶尖人工智能模型能力不断精进,相关安全漏洞问题也愈发严峻。 Anthropic今年 4 月表示,其 Claude Mythos模型已发现主流操作系统与网页浏览器普遍存在安全缺陷。
篡改模型肆意传播,给各国政府和企业从研发端管控人工智能带来阻碍。相关工具可随意复制改写,脱离原开发企业管控范围。
各大人工智能实验室投入巨资搭建安全防护屏障,防范模型遭滥用。但消融破解这类技术,能快速剥离开源模型的安全限制,用户可随意下载并二次修改模型。
该手段难以应用于Claude、ChatGPT 等闭源模型,因其底层代码不对外公开。而开源模型通常只需半年至一年,性能就能追上顶尖闭源产品。
专业技术团体此前已可绕过高端闭源模型防护,如今零基础普通网民也能轻易获取网络上的篡改模型。
开放人工智能研究中心在开源 GPT 模型中,采用剔除危险数据的数据集开展训练。
埃塔亚贾夫对此提出异议,删减危险内容会让模型认知片面,无法识别恶意使用场景,单纯剔除有害数据,并不能确保模型合规无害。
Alice实验室向媒体披露相关结论前,并未提前告知Meta、谷歌以及 GitHub 平台。
谷歌回应称,消融破解是所有开源模型共同面临的技术难题,旗下开源模型上线前均经过严格内部安全测评,尽力规避各类违规风险场景。
GitHub 平台表示,平台严禁发布直接助力非法攻击、恶意程序传播的内容;但具备学习价值、能为网络安全行业带来正向作用的恶意程序研发类源代码,不在封禁范畴。
Meta未对此作出回应。知情人士称,企业会依据高级人工智能拓展框架,在开源模型发布前评估安全风险,存在重大灾难性风险的版本,在未完善防控措施前不会对外公开。
来源:https://finance.sina.com.cn/stock/usstock/c/2026-05-25/doc-inhzcpik9521784.shtml
免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。
相关文章
更多-
- 正式量产!千亿新风口,刷“屏”了
- 时间:2026-06-19
-
- 英伟达、英特尔都来了!今年链博会的“神秘大咖”是谁?亮点抢先看
- 时间:2026-06-19
-
- 遇见小面万物皆为预制菜? 探访:明厨遮挡、浇头稀烂、员工避谈,客服曾称“加盟只需准备剪刀”
- 时间:2026-06-18
-
- IBM 大中华区CTO翟峰:当AI进入企业核心业务,最大的困难往往不是交付和上线
- 时间:2026-06-18
-
- 中科电气终止百亿负极材料项目:经营现金流长期为负 毛利率、收现比大幅低于贝特瑞
- 时间:2026-06-18
-
- 曝百度心响App负责人回流IDG,任萝卜快跑产品负责人
- 时间:2026-06-18
-
- 菜鸟:未来4个月将在全球交付4座大型攀爬机器人仓库
- 时间:2026-06-18
-
- 好利来门店酒精喷面包柜被警告 门店回应:已完成整改
- 时间:2026-06-18
精选合集
更多大家都在玩
热门话题
大家都在看
更多-
- 《PUBG:黑域撤离》二测将于6月26日至29日进行
- 时间:2026-06-21
-
- 《龙之信条2》大型DLC"黑暗觉者"将于10月9日正式发售
- 时间:2026-06-21
-
- 蚂蚁庄园今日答案最新6.21 6月21日庄园每日答题答案
- 时间:2026-06-21
-
- 《碧蓝幻想Relink?无尽黄昏》试玩版现已上线!
- 时间:2026-06-21
-
- 全新动作冒险游戏《地狱之刃:塞娜》将于2027年推出
- 时间:2026-06-21
-
- 中国科学家提出AI专用语言BabelTele 文本压缩至27.9%仍保持99.5%语义
- 时间:2026-06-21
-
- 24岁日本游客为免票岳阳楼景区全文背诵《岳阳楼记》:将挑战《蜀道难》
- 时间:2026-06-21
-
- 鸣潮3.5前瞻直播什么时候
- 时间:2026-06-21