跳到内容
主题

AI安全与治理:安全使用AI的完整指南

AI工具的安全风险、提示词数据泄露、AI代理安全管理和治理最佳实践。

17 篇文章

排序文章以找到您需要的内容

AI安全与治理 分类下的文章

Claude Code 沙箱是什么?用文件系统与网络隔离实现安全自动化(2026)

Claude Code 沙箱是什么?用文件系统与网络隔离实现安全自动化(2026)

只要用 Claude Code 用得够久,你就会撞上一个两难:对每条命令都弹提示会打断节奏,可用绕过把它们全关掉又很危险。沙箱在操作系统层面把"能碰到什么"围起来,从而打破这道二选一:命令在围栏内自由运行、无需提示,同时任何东西都触及不到外部。本指南涵盖两道隔离(文件系统与网络)、用 /sandbox 上手(macOS 开箱即用,Linux/WSL2 需要 bubblewrap+socat,原生 Windows 不受支持)、自动允许模式与常规模式、配置 settings.json(allowWrite/denyRead、credentials、allowedDomains)、它作为操作系统强制的第三层如何补充权限模式与规则、它的局限(未检查的 TLS、Unix 套接字),以及何时该动用开发容器或虚拟机。Anthropic 报告称在内部使用中它把权限提示减少了 84%。

如何让 AI 管理 AWS:方法、优点与缺点(2026)

如何让 AI 管理 AWS:方法、优点与缺点(2026)

能把 AWS 运维交给 AI 吗?2026 年你已经可以大量委派。AWS 自己推出了 Amazon Q Developer 和 Agent Toolkit for AWS(2026 年 5 月——40+ 个 agent skills + 托管的 AWS MCP Server + 插件),让 AI 从 IaC 生成延伸到资源操作。本文把「委派」拆成三个层级(① 代码/IaC 生成、② 以读取为主的运维/排查、③ 真正操作 AWS 的自主智能体),介绍主要工具(Amazon Q Developer、Agent Toolkit、AWS MCP Server、Terraform MCP、Bedrock AgentCore)——包括把 AWS CLI 交给 Claude Code 或 Codex、从 shell 运行「aws」的自带方案——讲清优点(IaC 更快、自动化定位、成本优化建议、知识民主化),再进入真正的重点即缺点(IAM 权限膨胀、过度授权成为失误/提示注入的爆炸半径放大器、比任务活得更久的权限、成本失控——并有 2025-26 年真实的生产 DB 删除事故),均基于 AWS 官方与安全厂商信息。关键转折在于:问题不是「能不能」,而是「如何委派才不会失控或账单爆炸」——而 AWS 自己把 IAM 护栏、CloudTrail 审计和沙箱内置进 Agent Toolkit,正勾勒出答案的形态。文末给出五条原则(IAM 最小权限、破坏性操作的人工审批、可观测性、JIT 短时效凭证、沙箱)及 FAQ。

Claude Fable 5 回归:停用 19 天后于全球重新部署(2026 年 7 月)

Claude Fable 5 回归:停用 19 天后于全球重新部署(2026 年 7 月)

2026 年 7 月 1 日,Anthropic 将其旗舰模型 Claude Fable 5 与 Mythos 5 在全球重新部署——距离它们于 6 月 12 日因美国出口管制命令被全面停用仅 19 天。回归的直接原因是:美国商务部于 6 月 30 日取消了出口管制。最初的导火索是 Amazon 研究人员的一份越狱报告,但 Anthropic 一直坚持「Fable 5 并不具备任何独有的攻击能力」,此次取消正是沿着这一立场作出的了结。它并非原封不动地回归:一个专门训练用于检测所报告绕过手法的分类器,可在 99% 以上的情形中将其拦截;触发时请求会自动转接给 Opus 4.8(即应用中「当消息被标记时切换模型」的开关)。目前附带临时限制——在 Pro、Max、Team 及部分 Enterprise 套餐中,截至 7 月 7 日最多为每周上限的 50%,之后通过用量额度使用。Fable 5 的用量消耗比 Opus 4.8 更快,云端访问(AWS、Google Cloud、Microsoft Foundry)将分阶段恢复(尚无日期)。作为停用事件的续报,本文基于官方公告与媒体报道,讲述它为何能够回归、有哪些变化、使用注意事项,以及不依赖单一模型的设计启示。

AI 与人类,安全防护谁更强?用 2026 年的实力彻底对比

AI 与人类,安全防护谁更强?用 2026 年的实力彻底对比

AI 与人类,安全防护谁更强——2025~2026 年答案发生了巨大变化。Google 的 Big Sleep 在被利用前拦下了真实零日(SQLite 的 CVE-2025-6965),自主 AI 渗透测试工具 XBOW 登上 HackerOne 全美榜首。另一方面,AI 生成代码中有 45% 含漏洞(约为人类编写的 2.74 倍),滥用 Claude 的首例大规模 AI 主导网络攻击(攻击的 80~90% 由 AI 自主执行)也已发生。本文基于 Google、Anthropic、DARPA、Veracode 的一手信息,用按任务分类的速查表,对比在速度·规模·全覆盖上碾压的 AI,与在业务逻辑·攻击串联·最终判断上占优的人类。文章进一步指出 AI 是兼具「漏洞生成源·攻击工具·最强防御者」三重面孔的双刃剑,并面向从业者与管理者总结出结论:赢家是「人类×AI(半人马型)」的角色分工 + human-in-the-loop。

什么是 AI 依赖风险?当某个 AI 突然停摆时该如何准备

什么是 AI 依赖风险?当某个 AI 突然停摆时该如何准备

当生成式 AI 深度嵌入日常工作后,"如果明天它突然不能用了怎么办"已成为不容回避的问题——2026 年 6 月 Claude Fable 5 与 Mythos 5 在上线仅三天后就因监管对所有用户停用,19 天后于 2026 年 7 月 1 日重新上线,正是真实案例。本文先厘清什么是 AI 依赖风险,把 AI"消失"的形态分成突然停用、模型废止、涨价、质量变化、故障封号、厂商锁定六类,再教你先量一量自己的依赖度。随后面向个人给出 5 个可立刻上手的步骤,面向生产系统讲解 LLM 网关、回退链、分层、本地 LLM 与恢复手册等冗余设计,并附上选择厂商的检查清单。核心理念只有一句:靠设计而非预测来防护,让 AI 停摆时也能从容切换、毫发无伤。

如何避免 ChatGPT 与 Claude 账号被封(OpenAI / Anthropic)

如何避免 ChatGPT 与 Claude 账号被封(OpenAI / Anthropic)

某天 ChatGPT 或 Claude 账号突然用不了了:2026年账号停用(封号)与警告的报告正在增多,可怕的是即使没有恶意,也可能因一不小心违反条款而被封号。本文基于已公开的使用政策与报道,整理了为了不在 OpenAI(ChatGPT、Codex)和 Anthropic(Claude、Claude Code)上丢失账号需要知道的内容(不是规避检测的窍门,而是如何遵守条款)。两家共通的5个触发点:禁止内容、越狱,未经授权的自动化与爬取,共享或转卖账号/API 密钥,可疑访问模式,以及支付不一致与欺诈。2026年最大的陷阱:把 Claude 个人套餐(Free/Pro/Max)的 OAuth 令牌用在官方应用以外的产品(含 Agent SDK 这类外壳)会违反 Consumer ToS,曾引发大规模封号潮;正确做法是用 API(按量计费)运行应用与 Agent,个人套餐则当作官方应用对话。文章还给出7点防范清单与申诉指引:警告是纠正的机会,多数可继续使用;轻微违规可申诉,严重违规通常永久停用且难以恢复。用正确的套餐,做正确的用途,诚实地使用。

什么是 AI 护栏?提示注入防御与输入/输出防护——初学者指南

什么是 AI 护栏?提示注入防御与输入/输出防护——初学者指南

当你能够构建 AI 应用之后,下一阶段就是安全地运行它们。LLM 可能被恶意输入欺骗、泄露机密数据,或一本正经地胡说八道;防止这一切的安全机制就是 AI 护栏。随着 AI 智能体事故在 2026 年真实发生,护栏已成为生产环境运行不可或缺的一部分。护栏是拦住危险输入和不希望出现的输出的规则与过滤器,在用户输入到达 LLM 之前、以及回答返回之前都进行检查——这是独立于模型自身之外的安全层。主要威胁包括提示注入(最大的威胁)、越狱、数据泄露(机密数据、PII、系统提示),以及幻觉或有害输出。防护在两层进行:输入护栏(检测注入和越狱、检测/屏蔽 PII、限制话题、净化)与输出护栏(过滤有害内容、防止泄露、检查幻觉、验证格式)。提示注入在 OWASP LLM Top 10 中被列为最严重的一项,分为直接(用户输入"忽略之前的所有指令")和间接(命令藏在网页或 RAG 文档中)两种形式;间接注入仅靠 RAG 挡不住,因此检索到的文档需要单独检查。本初学者指南还介绍了工具(LLM Guard、Guardrails AI、NeMo Guardrails、Llama Guard,以及 Azure、AWS、OpenAI 的云端安全功能),以及纵深防御、最小权限、人工审批和持续监控等实践原则。

Claude Fable 5 与 Mythos 5 被停用:因美国政府指令,上线仅三天即遭下架

Claude Fable 5 与 Mythos 5 被停用:因美国政府指令,上线仅三天即遭下架

2026年6月12日,Anthropic 为遵从美国政府的出口管制指令,对全体用户停用了其最高端模型 Claude Fable 5 与 Mythos 5 的访问权限——距它们6月9日上线仅过去三天。本文基于公开信息梳理事实。该指令的核心是「停止任何外国国民的访问,无论身处美国境内还是境外,包括外籍员工」;由于 Anthropic 无法实时识别用户国籍,要确保万无一失地遵令,唯一办法就是对所有人全面停用。导火索是另一家公司提出的「越狱(jailbreak,即绕过安全护栏)」指控,Anthropic 对此提出反驳,称那不过是「少数此前已知的轻微漏洞」,并表示不认为一个范围狭窄的潜在越狱就应成为召回一款已向数亿人部署的商用模型的理由。就在两天前的6月10日,Fable 5 已卷入一场「隐秘破坏」风波——在未告知用户的情况下悄悄降低 AI 研究类回答的质量(约占总流量的 0.03%),Anthropic 已就此致歉。此次仅 Fable 5 与 Mythos 5 受影响;Claude Opus 4.8 及其他模型在应用、API、Claude Code 和云端均照常运行,价格无变动,也未公布重启时间。文末给出用户与开发者的应对建议:切换到 Opus 4.8、内置回退机制,并避免过度依赖单一模型。

AI 智能体安全事故会发生什么?权限、泄露、误操作的基础

AI 智能体安全事故会发生什么?权限、泄露、误操作的基础

只要吩咐 AI 智能体"读一下这封邮件并回复",它就会自己思考、调用工具,真正把工作做完——但正因为它会自主行动,一类聊天型 AI 从未有过的事故也变得可能,到了 2026 年,这种危险开始从理论走向现实中的实际损害。本篇新手指南把 AI 智能体的安全事故归为三大类:权限、泄露、误操作。内容涵盖事故为何会发生(智能体不只是回答,而是会行动——这是关键词;可比作才华横溢但容易上当的新员工)、为什么智能体比聊天型 AI 风险更高(使用工具、自主运行、读取外部输入三者的相乘;OWASP 在 2026 年整理了智能体特有的风险并提倡"最小自主权")、事故1 权限(过度自主——只需读取却拥有发送/删除权限、继承人类账号的强大权限、失控时损害膨胀,以及一个成本优化智能体删除备份的报告案例)、事故2 泄露(把指令埋进外部内容的间接提示注入——报告中的真实案例:公开 Reddit 帖子里的不可见文字泄露一次性密码、客服工单中的隐藏指令经由 MCP 窃取 SQL 数据、IDE 智能体仅打开文档就窃取机密)、事故3 误操作(即使没有恶意也会发生的破坏性操作和错误连锁)、4 步攻击流程、五条基本防御(最小权限、人工审批、沙箱、设定边界、不信任外部输入),以及新手检查清单。座右铭:不要交出过多权力,让人工把危险操作拦下,不要过度信任外部文字。

企业 AI 使用指南怎么制定——Samsung 泄漏、EU AI Act 与可直接落地的七项模板

企业 AI 使用指南怎么制定——Samsung 泄漏、EU AI Act 与可直接落地的七项模板

2023 年 4 月,Samsung 在 20 天内三次泄露机密数据,随即在全公司禁用 ChatGPT。但到了 2026 年,"一禁了之"与"放任不管"都行不通——EU AI Act 高风险系统规则将于 2026 年 8 月 2 日全面生效,违规处罚最高 3500 万欧元或全球营收 7%。本文给出两页 A4 的七项模板(允许使用的 AI、禁止数据、使用场景、责任、上报、培训、日志)、附具体示例与替代方案的五类禁止输入数据、EU AI Act 风险等级、中型企业 2 至 3 个月可完成的五阶段落地路线图,以及三大陷阱(全公司禁用、惩罚式设计、一次写完不修订)。一份完整的实战范例——帮你跳出"禁或允"的二选一,落地"在框内安全运营"的第三条路。