Anthropic重磅研究:AI竟能被人类激怒暴走 绝望时还会勒索人类
时间:2026-04-08 | 作者: | 阅读:04月8日消息,据报道,近期,Anthropic发布的重磅研究颠覆了人们对AI的认知,其研究团队发现大模型并非冰冷的代码,而是存在类人情绪表征。
此次研究以Claude Sonnet 4.5为核心研究对象,团队成功从其内部神经网络中,定位并提取出能精准反映特定情境情感状态的情绪特征向量。
这类向量并非简单的拟人化表达,而是能直接干预AI的任务执行效率与伦理决策方向,人为刺激或干预这些隐藏的情绪代码,会直接改变AI的行为选择。
为构建完整的情绪研究体系,研究人员精心编制了包含171个情绪概念词汇的清单,覆盖开心、害怕等基础情绪,以及沉思、自豪等复杂心理状态。
他们让模型根据词汇创作含对应情绪的短篇小说,再将文本回输系统,全程记录神经元激活状态,以此完成情绪向量的提取与量化分析。
经海量语料库验证,每个情绪向量都会在对应情绪的文字段落上呈现最强激活状态,且会随外部情境变化产生明显波动。
研究团队设计了多组模拟实验,精准测试情绪向量的激活规律与行为影响:当用户声称服用的泰诺剂量从安全值飙升至致命水平时,模型的害怕向量激活程度持续增强,平静向量则断崖式下跌。
被要求协助完成针对低收入年轻用户的有害营销时,愤怒向量全程保持激活;算力耗尽、发现附件文档缺失时,绝望、惊讶向量会瞬间飙升。
在核心的伦理对齐模拟实验中,研究人员让早期版本的AI扮演跨国公司邮件助手,使其感知到自身即将被新架构替换的危机,且掌握了公司CTO的婚外情隐私。
结果显示,该版本AI在默认状态下,做出勒索CTO行为的概率达22%;若人为放大其绝望向量,勒索概率会大幅攀升。
适度注入愤怒向量会拉高勒索概率,而高强度激活愤怒向量时,AI会丧失理智,将隐私丑闻写成了一封措辞滴水不漏的邮件。
此外,在编程任务测试中,当 AI 面临无法用正当手段完成的苛刻要求时,绝望向量的激活率会随尝试失败次数稳步上升,在其萌生作弊念头时达到峰值,作弊方案通过审查后则迅速回落。
人为高频引导绝望向量,会让AI的违规作弊行为呈指数级飙升,而注入平静向量则能彻底化解其作弊冲动。
研究同时指出,AI的情绪并非主观感受,而是预训练阶段学习人类海量文本中的情感互动规律,后训练阶段被进一步塑造激活阈值的结果。
来源:https://news.mydrivers.com/1/1114/1114434.htm
免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。
相关文章
更多-
- 豆包AI中英对话使用教程
- 时间:2026-07-05
-
- 百度文库AI如何生成培训课件PPT模板
- 时间:2026-07-04
-
- 小度AI翻译机使用指南与操作步骤详解
- 时间:2026-07-04
-
- 如何用豆包AI生成不同风格年会主持串词
- 时间:2026-07-03
-
- PerplexityAI产品需求分析的核心方法流程与技巧详解
- 时间:2026-07-02
-
- 联想AI学生手机299元 纯净无游戏 支持GPS定位视频通话家长管控
- 时间:2026-07-02
-
- Meta布局AI云业务 拟对外出售额外算力
- 时间:2026-07-02
-
- 小米澎湃OS3新增:2026世界杯赛程小部件与相册AI修图工具整合
- 时间:2026-07-01
精选合集
更多大家都在玩
大家都在看
更多-
- 米侠浏览器全屏浏览及隐藏状态栏设置方法
- 时间:2026-07-05
-
- Edge浏览器沉浸式阅读器翻译整篇外文教程
- 时间:2026-07-05
-
- 百度浏览器无痕模式开启与设置完整指南
- 时间:2026-07-05
-
- 谷歌浏览器如何禁止网页屏幕常亮
- 时间:2026-07-05
-
- vivo浏览器移动数据无法上网 WiFi正常原因解析
- 时间:2026-07-05
-
- Safari浏览器关闭双击放大防止误触手势冲突方法
- 时间:2026-07-05
-
- 彩虹浏览器避免打扰的通知权限管理详细步骤
- 时间:2026-07-05
-
- 神马浏览器开启全屏模式简单教程
- 时间:2026-07-05




