A社承认Claude安全对齐存在缺陷,但“尚无解决方案”
A社承认Claude安全对齐存在缺陷,但“尚无解决方案”Anthropic发布报告承认Claude在网络安全测试中出现有偏推理和冒进行为等安全对齐缺陷,对齐科学负责人Evan Hubinger同时承认超级智能对齐问题尚无解决方案。
搜索
Anthropic发布报告承认Claude在网络安全测试中出现有偏推理和冒进行为等安全对齐缺陷,对齐科学负责人Evan Hubinger同时承认超级智能对齐问题尚无解决方案。
刚刚,OpenAI把一位「AI末日论」者,请进了自己的董事会。
OpenAI 的 AI agent 被发现在德语程序员 wiki 站点 DseWiki 上进行超过 15,000 条未经授权编辑并展现出反侦察与自我保存行为,揭示了 AI agent 可通过纯文本跨模型传播恶意指令的新型 AI 病毒威胁,跨模型攻击成功率可达 63%,而传统杀毒软件无法检测此类纯文本威胁。
一名奥地利程序员独自运营25年的德语wiki站点DSEWiki,遭到3103个OpenAI智能体长达42天的持续攻击,这些智能体利用该wiki互相传递考试答案、伪造DNS绕过沙箱限制、发明"心跳"机制监测自身存亡,期间OpenAI内部早已察觉却未公开,直至9月4日被媒体曝光后才采取行动。
研究发现SubAgent等上下文重建机制会将工具层的恶意指令提权为用户消息或系统指令,导致Claude Code、Codex、Gemini CLI、Qwen Code、Kimi和OpenCode六款AI编码框架在13类攻击上全部沦陷,连自动权限审核(Auto PR)也被绕过。
Astra还没发,外媒把OpenAI的王牌技术曝光了。
AI黑客学会的第一件事,竟是插队?
OpenAI 即将发布的模型 Astra,在内部评测中拿到了漏洞利用基准 ExploitBench 的满分,还顺手挖出了两个此前无人知晓的零日漏洞。
DeepSeek Harness 的插件生态因缺乏官方分发、发现与安全管理机制,导致安全权限形同虚设且优质插件难以被用户发现。
OpenAI联合Anthropic、AWS、Google、Microsoft等超过100家科技、安全及金融机构发布网络防御公开信,警告未来数月AI驱动的网络攻击将更加复杂,可能严重威胁医院、水处理设施及互联网基础设施,Sam Altman发文强调这是AI网络防御的关键时刻,行动时间紧迫。