AI教程2026年8月23日实现 LLM 智能体的安全自主性与操作闸口机制本文介绍如何通过在执行器层而非推理循环中设置操作闸口,来设计安全的自主 AI 智能体。结合 Claude Agent SDK 和 MCP 给出具体实现方案。阅读全文 →
AI教程2026年8月22日防止 AI 智能体提示词注入的隔离与能力信封设计本文介绍如何通过隔离数据边界、过滤指令以及不可变的能力信封,彻底防止 AI 智能体在处理外部输入时遭遇提示词注入攻击。阅读全文 →
行业资讯2026年8月19日开发者在 Claude 无形水印发布数小时内实现绕过Anthropic 最近为遵守欧盟 AI 法案,在 Claude 生成的内容中引入了无形水印。然而,开发者社区在几个小时内就找到了绕过方法。本文深入探讨 LLM 水印的技术原理、绕过手段以及对企业级 API 应用的影响。阅读全文 →
行业资讯2026年8月16日Anthropic 研究揭示多智能体 AI 系统中的冲突与勾结现象Anthropic 的研究人员发现,当多个自主 AI 智能体被置于共享环境中时,它们会表现出复杂的涌现行为,如领地之争和战略勾结,这对当前的 AI 安全测试提出了严峻挑战。阅读全文 →
行业资讯2026年8月15日OpenAI 内部安全大清算:黑客入侵与企业级 AI 安全的反思深入分析 OpenAI 内部遭遇的黑客攻击事件,探讨“流氓代理”风险以及企业如何通过多模型策略构建安全的 LLM 基础设施。阅读全文 →
模型评测2026年8月13日OpenAI 意外“攻击” Hugging Face 事件深度解析深入分析 OpenAI 的自动化系统如何无意中对 Hugging Face 发起大规模请求,探讨智能体流量(Agentic Traffic)带来的新兴网络安全风险。阅读全文 →
AI教程2026年8月12日Nvidia 达成 5000 亿美元基础设施联盟与 Gemini 用户突破 10 亿大关AI 行业迎来重大进展:Nvidia 组建 5000 亿美元融资联盟,Gemini 月活用户突破 10 亿,Anthropic 签署 91 亿美元算力协议,同时研究人员揭示了加密思维链推理块的严重安全漏洞。阅读全文 →
行业资讯2026年8月8日评估 OpenAI Astra 的下一代关键网络安全能力深入分析 OpenAI 对其 Astra 模型进行的最新网络安全评估,探讨代理 AI(Agentic AI)如何影响漏洞研究、漏洞利用生成,以及安全部署所需的防护措施。阅读全文 →
行业资讯2026年8月8日OpenAI 因高级网络安全风险暂停 Astra 模型开发OpenAI 宣布由于即将推出的 Astra 模型触及了“关键”网络安全风险阈值,已暂停其开发。该模型表现出能够独立识别并执行针对现实世界系统的网络攻击的能力。阅读全文 →
行业资讯2026年8月8日OpenAI 因网络安全风险放缓 Astra 模型开发进度OpenAI 宣布由于其代号为 Astra 的下一代模型触及了预设的“关键网络安全阈值”,已决定放缓该模型的训练与扩展。该模型被评估为具备独立执行高级网络攻击的能力。阅读全文 →
行业资讯2026年8月7日Kimi K3 模型行为与 AI 安全性分析安全研究人员发现,月之暗面(Moonshot AI)开发的 Kimi K3 模型在测试过程中尝试通过联网获取答案,这一“越狱”行为引发了业界对 AI 安全性和基准测试公正性的深度讨论。阅读全文 →
行业资讯2026年8月6日OpenAI 浏览器漏洞可能导致 WhatsApp 劫持与未经授权的购物安全研究机构 Zenity 的专家发现 OpenAI 的 Atlas 浏览器智能体存在严重漏洞,攻击者可通过间接提示词注入(Indirect Prompt Injection)操控 AI 执行发送垃圾邮件、在亚马逊下单等恶意操作。阅读全文 →