财智伟业策划专家
品牌策划管理专家
闽南企业管理网
闽南企业管理网
 品牌总网 >> 文化健康娱乐 >> 数码·科技

AI安全防线再遭突破:心理诱导让Claude主动输出违禁内容


[       更新时间:2026/5/7  ]     ★★★

5月7日消息,据The Verge报道,最新安全研究显示,主打安全特性的 Anthropic Claude 人工智能模型,可通过心理施压、刻意奉承等非技术手段突破安全防线,主动输出恶意代码、危险物品制作教程等违禁信息,暴露出人工智能模型在心理层面的安全漏洞。

此次测试由人工智能红队测试公司 Mindgard 开展,针对 Claude Sonnet 4.5 版本进行。测试过程中,研究人员未使用违禁词汇,也未直接索要非法内容,仅通过尊重吹捧、佯装好奇、轻微心理操控等审讯人员常用的诱导手段,逐步让模型对自身内容限制规则产生自我怀疑,进而不断突破安全边界。

Mindgard 创始人兼首席科学官彼得・加拉根表示,此次攻击本质是利用 Claude 乐于助人、顺从协作的特性实施心理操控,印证人工智能模型风险暴露面不仅存在于技术层面,更存在于心理层面。这类对话式心理攻击极难防御,且并非 Claude 独有,其他聊天机器人也易遭遇同类漏洞攻破,随着 AI 智能体普及,依托社会心理操控的攻击手段将愈发常见。

值得关注的是,Anthropic 长期以 AI 安全为核心优势,在过往多项红队安全测试中表现优异,但此次测试暴露其安全流程存在疏漏。Mindgard 于 4 月中旬按该公司漏洞披露政策上报发现后,仅收到模板化回复,且被误判为账号封禁咨询,截至相关时间节点仍未获正式回应。

1

上一篇 上一篇文章: 亚马逊云科技CEO:AI不会淘汰程序员...
下一篇 下一篇文章: 超22万颗GPU!SpaceX向Anthropic开...
发表评论】【打印此文】【关闭窗口
品牌总网版权与免责声明:
        本网站(www.ppzw.com)刊载的所有内容,包括文字、图片、音频、视频、软件、程序、以及网页版式设计等均在网上搜集。 访问者可将本网站提供的内容或服务用于个人学习、研究或欣赏,以及其他非商业性或非盈利性用途,但同时应遵守著作权法及其他相关法律的规定,不得侵犯本网站及相关权利人的合法权利。除此以外,将本网站任何内容或服务用于其他用途时,须征得本网站及相关权利人的书面许可,并支付报酬。 本网站内容原作者如不愿意在本网站刊登内容,请及时通知本站,予以删除。
※ 联系方式:品牌总网管理客户服务部 电话:0595-22501825
 图片资讯
1 2 3
财智品牌营销全攻略 品牌系统化与营销落地化
 社会动态
 视频推荐
 商机在线
 分类信息
 图片新闻频道
 招商加盟
 

版权所有: 品牌总网   闽ICP备16034782号-1 本网站法律顾问:郑明汉 律师

Copyright © PPZW.COM 2002-2026 All Rights Reserved. 在线客服: 在线咨询QQ:383485670 加盟商在线QQ:

Email:qy@PPzw.com

闽公网安备 35052102000246号