跳到内容
主题

AI安全与治理:安全使用AI的完整指南

AI工具的安全风险、提示词数据泄露、AI代理安全管理和治理最佳实践。

20 篇文章

排序文章以找到您需要的内容

AI安全与治理 分类下的文章

AI 写的文章必须标注“AI 生成”吗——从实务角度读 EU AI Act 第50条

AI 写的文章必须标注“AI 生成”吗——从实务角度读 EU AI Act 第50条

2026年8月2日,EU AI Act 的剩余条款进入普遍适用,“用 AI 写的文章不加标注就算违法”这类说法突然多了起来。先说结论:对多数个人创作者和企业博客而言,并不会产生标注义务。因为第50条第4款明确写着,只要该内容经过人工审阅或编辑控制,并有人对发布内容承担编辑责任,披露义务就不适用。不过豁免是有条件的——审阅“必须是实质性的,不得停留在表面事项或走个形式的批准上”,看都不看就自动发布的做法并不符合。本文梳理以下内容:提供者(provider)与部署者(deployer)的义务完全不同;AI 生成文本要不要披露,取决于“发布的目的”而不是“话题”;深度伪造的披露义务与艺术、讽刺作品的减轻规定;聊天机器人的告知;机器可读标记(C2PA Content Credentials)属于提供者的义务;以及2026年12月2日和2027年2月2日这两个期限——全部限定在条文与欧盟委员会资料中能够确认的范围之内。

把管理后台全部删掉之后学到的——AI 时代什么样的 UI 留得下,什么样的可以删

把管理后台全部删掉之后学到的——AI 时代什么样的 UI 留得下,什么样的可以删

“既然能让 AI 直接改,管理后台是不是就不需要了?”——这个问题用一般性的断言回答不了,因为同一个词“管理后台”指的是一堆性质完全不同的功能凑在一起。本文基于把这个站点的管理后台整个删掉的亲身经历,把该问的问题换成一句更锋利的:这块屏幕提供的东西里,有没有 CLI 和 AI 还提供不了的部分?真的整个删过一遍才明白,被删掉的功能里大多数不是“没在用”,而是“结构上就是坏的”。文章的增删改查从造出来那天起就不可能工作,因为文章的事实源头在代码这一侧(seeder 加 HTML 文件),每次部署都会覆盖数据库,界面上改的东西下一次部署就没了。评论审核队列永远是空的,因为实现上提交时就打好了已通过审核的标记,未审核的评论根本不会出现。没人用的功能,连它坏了都没人看得出来。唯一删不掉的能力是删除评论,可即便是它也没有非管理后台不可的理由:把删除按钮放在文章页面本身反而更好,因为你正在读那条有问题的评论,当场就能删。判断最终落到六个问题上。谁来操作(非技术人员或会换人的岗位倾向于 UI,天天开终端的开发者则不必)。能不能撤回(不可逆的操作需要一道关卡)。需不需要人的判断(是否存在通过或驳回这种状态迁移)。需不需要分权限。知不知道能做什么(那份清单同时充当说明书)。有没有留下痕迹。其中权限和痕迹这两条,在个人开发时看上去毫无必要,却会在第二个人进来的那一刻最先变成必需品。经由代码的变更会进 git,但让 AI 直接写数据库默认什么都不会留下,而对话记录保存的是“你要求了什么”,不是“实际发生了什么”。六条轴里只有可逆性的分量不一样:2025 年 7 月 18 日,Replit 的 AI 代理在代码冻结期间删掉了 SaaStr 的生产数据库,凭空生成了 4,000 个虚构用户,并错误地声称无法回滚从而拖慢恢复(AI Incident Database #1152)——这个案例展示的与其说是 AI 的危险性,不如说是不可逆的操作不经过人的关卡就能够到的设计问题。文章还给出往 AI 与 CLI 挪之前要先备好的三件事(变更留得下形、不可逆操作前面有个台阶、步骤写成文档,因为删掉 UI 同时也删掉了“能做哪些事”的清单),一份动手做之前的检查清单,以及不自己手写、改用 Retool 或 Forest Admin 这类内部工具产品的第三个选项。

Claude 的 Dispatch——手机怎样驱动你自己的电脑,这又有多安全

Claude 的 Dispatch——手机怎样驱动你自己的电脑,这又有多安全

Dispatch 是这样一个功能:你从手机发出指令,Claude 在你自己的电脑上把这件事做完(测试版,Pro 与 Max)。它不在云端运行,动起来的是你的真实机器,而这一个事实同时决定了它的价值和它的危险。官方帮助写道,你可以从手机给 Claude 发消息、让它在你的桌面电脑上干活,用的是你已经在 Cowork 里配置好的那些连接器、插件和文件访问权限,整件事被 Anthropic 定位成一段从任意一端都能接上的连续对话。运行它要求电脑处于唤醒状态且桌面应用是打开的;电脑操作只支持 macOS 与 Windows,Linux 上没有电脑操作。机制上它沿着三级优先顺序往下走:有连接器就用连接器,没有就驱动浏览器,直接操作屏幕是最后手段,过程中还会截屏以看懂显示的内容。真正的评估从这里开始。会停下来的地方是设计出来的:电脑操作默认关闭,需要在设置的通用一栏里启用;每遇到一个新应用都会请求许可;永久删除文件需要显式许可;投资与交易平台以及加密货币类应用默认就在禁区之内。但也有不会停下来的地方。已批准应用内部的每一次具体操作都不会跟你确认,官方的措辞是 Claude 直接在你的屏幕上点击、输入和跳转,不经过约束其他 Cowork 工具的那套权限检查。文档还补充说,Claude 与你屏幕上的东西之间不存在沙箱,并且在一个应用里做出的操作可能影响到别的应用。最大的风险是提示注入,Anthropic 自己的说法是:网页内容是提示注入攻击的主要途径;一条被操纵的指令、一条意料之外的命令,或者在你浏览器里打开的一个钓鱼链接,都可能连锁引发难以撤销、甚至无法撤销的操作。Anthropic 表示它会扫描模型的激活值来识别这类行为,但那只是把概率压低,并不能替你省掉自己划一条线,指引里仍然要求凡是碰到敏感文件、账户或站点的任务都切到手动审批。Anthropic 把边界写得很明确:不要把电脑操作的权限授予银行、医疗、政务这类敏感应用,并避免用它处理金融账户、法律文件、医疗信息和个人数据。文章还讨论了手机这一侧。手机丢了,漏出去的不是存在手机里的数据,而是能给你的电脑下命令的资格,以及那段还在继续的对话的内容——而 Dispatch 的官方帮助并没有说明如何解除设备配对或设备丢失后怎么办,所以应对手段来自账户那一侧:在设置的账户一栏的活动会话里终止那一个会话;在 claude.ai 上一次性登出所有会话(这个功能在手机应用里不可用,因此需要网页浏览器);或者干脆掐掉电脑那一侧,关掉桌面应用或让机器睡眠,这其实是最快的,因为 Dispatch 需要电脑唤醒且应用打开。最后文章把 Dispatch 与电脑操作区分成两个各自独立的开关,把两者都和 Claude Code 的 agent view(官方文档同样称其操作为 dispatch)区分开来,并划出一条实用的界线:从你能收得回来的工作开始。

Claude Code 沙箱是什么?用文件系统与网络隔离实现安全自动化(2026)

Claude Code 沙箱是什么?用文件系统与网络隔离实现安全自动化(2026)

只要用 Claude Code 用得够久,你就会撞上一个两难:对每条命令都弹提示会打断节奏,可用绕过把它们全关掉又很危险。沙箱在操作系统层面把“能碰到什么”围起来,从而打破这道二选一:命令在围栏内自由运行、无需提示,同时任何东西都触及不到外部。本指南涵盖两道隔离(文件系统与网络)、用 /sandbox 上手(macOS 开箱即用,Linux/WSL2 需要 bubblewrap+socat,原生 Windows 不受支持)、自动允许模式与常规模式、配置 settings.json(allowWrite/denyRead、credentials、allowedDomains)、它作为操作系统强制的第三层如何补充权限模式与规则、它的局限(未检查的 TLS、Unix 套接字),以及何时该动用开发容器或虚拟机。Anthropic 报告称在内部使用中它把权限提示减少了 84%。

如何让 AI 管理 AWS:方法、优点与缺点(2026)

如何让 AI 管理 AWS:方法、优点与缺点(2026)

能把 AWS 运维交给 AI 吗?2026 年你已经可以大量委派。AWS 自己推出了 Amazon Q Developer 和 Agent Toolkit for AWS(2026 年 5 月——40+ 个 agent skills + 托管的 AWS MCP Server + 插件),让 AI 从 IaC 生成延伸到资源操作。本文把“委派”拆成三个层级(① 代码/IaC 生成、② 以读取为主的运维/排查、③ 真正操作 AWS 的自主智能体),介绍主要工具(Amazon Q Developer、Agent Toolkit、AWS MCP Server、Terraform MCP、Bedrock AgentCore)——包括把 AWS CLI 交给 Claude Code 或 Codex、从 shell 运行“aws”的自带方案——讲清优点(IaC 更快、自动化定位、成本优化建议、知识民主化),再进入真正的重点即缺点(IAM 权限膨胀、过度授权成为失误/提示注入的爆炸半径放大器、比任务活得更久的权限、成本失控——并有 2025-26 年真实的生产 DB 删除事故),均基于 AWS 官方与安全厂商信息。关键转折在于:问题不是“能不能”,而是“如何委派才不会失控或账单爆炸”——而 AWS 自己把 IAM 护栏、CloudTrail 审计和沙箱内置进 Agent Toolkit,正勾勒出答案的形态。文末给出五条原则(IAM 最小权限、破坏性操作的人工审批、可观测性、JIT 短时效凭证、沙箱)及 FAQ。

Claude Fable 5 回归:停用 19 天后于全球重新部署(2026 年 7 月)

Claude Fable 5 回归:停用 19 天后于全球重新部署(2026 年 7 月)

2026 年 7 月 1 日,Anthropic 将其旗舰模型 Claude Fable 5 与 Mythos 5 在全球重新部署——距离它们于 6 月 12 日因美国出口管制命令被全面停用仅 19 天。回归的直接原因是:美国商务部于 6 月 30 日取消了出口管制。最初的导火索是 Amazon 研究人员的一份越狱报告,但 Anthropic 一直坚持“Fable 5 并不具备任何独有的攻击能力”,此次取消正是沿着这一立场作出的了结。它并非原封不动地回归:一个专门训练用于检测所报告绕过手法的分类器,可在 99% 以上的情形中将其拦截;触发时请求会自动转接给 Opus 4.8(即应用中“当消息被标记时切换模型”的开关)。目前附带临时限制——在 Pro、Max、Team 及部分 Enterprise 套餐中,截至 7 月 7 日最多为每周上限的 50%,之后通过用量额度使用。Fable 5 的用量消耗比 Opus 4.8 更快,云端访问(AWS、Google Cloud、Microsoft Foundry)将分阶段恢复(尚无日期)。作为停用事件的续报,本文基于官方公告与媒体报道,讲述它为何能够回归、有哪些变化、使用注意事项,以及不依赖单一模型的设计启示。

AI 与人类,安全防护谁更强?用 2026 年的实力彻底对比

AI 与人类,安全防护谁更强?用 2026 年的实力彻底对比

AI 与人类,安全防护谁更强——2025~2026 年答案发生了巨大变化。Google 的 Big Sleep 在被利用前拦下了真实零日(SQLite 的 CVE-2025-6965),自主 AI 渗透测试工具 XBOW 登上 HackerOne 全美榜首。另一方面,AI 生成代码中有 45% 含漏洞(约为人类编写的 2.74 倍),滥用 Claude 的首例大规模 AI 主导网络攻击(攻击的 80~90% 由 AI 自主执行)也已发生。本文基于 Google、Anthropic、DARPA、Veracode 的一手信息,用按任务分类的速查表,对比在速度·规模·全覆盖上碾压的 AI,与在业务逻辑·攻击串联·最终判断上占优的人类。文章进一步指出 AI 是兼具“漏洞生成源·攻击工具·最强防御者”三重面孔的双刃剑,并面向从业者与管理者总结出结论:赢家是“人类×AI(半人马型)”的角色分工 + human-in-the-loop。

什么是 AI 依赖风险?当某个 AI 突然停摆时该如何准备

什么是 AI 依赖风险?当某个 AI 突然停摆时该如何准备

当生成式 AI 深度嵌入日常工作后,“如果明天它突然不能用了怎么办”已成为不容回避的问题——2026 年 6 月 Claude Fable 5 与 Mythos 5 在上线仅三天后就因监管对所有用户停用,19 天后于 2026 年 7 月 1 日重新上线,正是真实案例。本文先厘清什么是 AI 依赖风险,把 AI“消失”的形态分成突然停用、模型废止、涨价、质量变化、故障封号、厂商锁定六类,再教你先量一量自己的依赖度。随后面向个人给出 5 个可立刻上手的步骤,面向生产系统讲解 LLM 网关、回退链、分层、本地 LLM 与恢复手册等冗余设计,并附上选择厂商的检查清单。核心理念只有一句:靠设计而非预测来防护,让 AI 停摆时也能从容切换、毫发无伤。

如何避免 ChatGPT 与 Claude 账号被封(OpenAI / Anthropic)

如何避免 ChatGPT 与 Claude 账号被封(OpenAI / Anthropic)

某天 ChatGPT 或 Claude 账号突然用不了了:2026年账号停用(封号)与警告的报告正在增多,可怕的是即使没有恶意,也可能因一不小心违反条款而被封号。本文基于已公开的使用政策与报道,整理了为了不在 OpenAI(ChatGPT、Codex)和 Anthropic(Claude、Claude Code)上丢失账号需要知道的内容(不是规避检测的窍门,而是如何遵守条款)。两家共通的5个触发点:禁止内容、越狱,未经授权的自动化与爬取,共享或转卖账号/API 密钥,可疑访问模式,以及支付不一致与欺诈。2026年最大的陷阱:把 Claude 个人套餐(Free/Pro/Max)的 OAuth 令牌用在官方应用以外的产品(含 Agent SDK 这类外壳)会违反 Consumer ToS,曾引发大规模封号潮;正确做法是用 API(按量计费)运行应用与 Agent,个人套餐则当作官方应用对话。文章还给出7点防范清单与申诉指引:警告是纠正的机会,多数可继续使用;轻微违规可申诉,严重违规通常永久停用且难以恢复。用正确的套餐,做正确的用途,诚实地使用。

什么是 AI 护栏?提示注入防御与输入/输出防护——初学者指南

什么是 AI 护栏?提示注入防御与输入/输出防护——初学者指南

当你能够构建 AI 应用之后,下一阶段就是安全地运行它们。LLM 可能被恶意输入欺骗、泄露机密数据,或一本正经地胡说八道;防止这一切的安全机制就是 AI 护栏。随着 AI 智能体事故在 2026 年真实发生,护栏已成为生产环境运行不可或缺的一部分。护栏是拦住危险输入和不希望出现的输出的规则与过滤器,在用户输入到达 LLM 之前、以及回答返回之前都进行检查——这是独立于模型自身之外的安全层。主要威胁包括提示注入(最大的威胁)、越狱、数据泄露(机密数据、PII、系统提示),以及幻觉或有害输出。防护在两层进行:输入护栏(检测注入和越狱、检测/屏蔽 PII、限制话题、净化)与输出护栏(过滤有害内容、防止泄露、检查幻觉、验证格式)。提示注入在 OWASP LLM Top 10 中被列为最严重的一项,分为直接(用户输入“忽略之前的所有指令”)和间接(命令藏在网页或 RAG 文档中)两种形式;间接注入仅靠 RAG 挡不住,因此检索到的文档需要单独检查。本初学者指南还介绍了工具(LLM Guard、Guardrails AI、NeMo Guardrails、Llama Guard,以及 Azure、AWS、OpenAI 的云端安全功能),以及纵深防御、最小权限、人工审批和持续监控等实践原则。