Перейти к содержимому
Темы

Безопасность и управление ИИ: полное руководство

Риски безопасности AI-инструментов, утечки данных, безопасность AI-агентов и лучшие практики управления.

17 статей

Сортируйте статьи, чтобы найти нужное

Статьи в категории Безопасность и управление ИИ

Что такое песочница Claude Code? Изоляция файловой системы и сети для безопасной автоматизации (2026)

Что такое песочница Claude Code? Изоляция файловой системы и сети для безопасной автоматизации (2026)

Поработайте с Claude Code подольше — и наткнётесь на дилемму: запрос на каждую команду тормозит работу, а отключить их все через обход опасно. Песочница ломает этот бинарный выбор, огораживая на уровне ОС то, к чему можно прикоснуться, так что команды свободно выполняются внутри без запросов, а наружу ничто не выходит. В гайде: две изоляции (файловая система и сеть), старт с /sandbox (macOS работает из коробки, для Linux/WSL2 нужны bubblewrap+socat, нативная Windows не поддерживается), режим auto-allow против обычного, настройка settings.json (allowWrite/denyRead, credentials, allowedDomains), как она дополняет режимы и правила разрешений в качестве третьего слоя, обеспечиваемого ОС, её ограничения (неинспектируемый TLS, Unix-сокеты) и когда стоит взять dev-контейнер или ВМ. Anthropic сообщает, что во внутреннем использовании она сократила число запросов разрешений на 84%.

Как доверить управление AWS ИИ: методы, плюсы и минусы (2026)

Как доверить управление AWS ИИ: методы, плюсы и минусы (2026)

Можно ли передать эксплуатацию AWS искусственному интеллекту? В 2026 году делегировать можно многое. Сама AWS поставляет Amazon Q Developer и Agent Toolkit for AWS (май 2026 — 40+ навыков агента + управляемый AWS MCP Server + плагины), так что ИИ дотягивается от генерации IaC до операций с ресурсами. Это руководство разбивает «делегирование» на три уровня (① генерация кода/IaC, ② эксплуатация/расследование с упором на чтение, ③ автономный агент, реально управляющий AWS), рассматривает основные инструменты (Amazon Q Developer, Agent Toolkit, AWS MCP Server, Terraform MCP, Bedrock AgentCore) — включая путь «со своим инструментом», когда Claude Code или Codex получают AWS CLI для запуска «aws» из shell, — плюсы (быстрый IaC, автоматическая сортировка, идеи по оптимизации затрат, демократизация знаний), а затем самое главное — минусы (разрастание прав IAM, избыток прав как усилитель радиуса поражения ошибок/инъекций промпта, права, переживающие задачу, неконтролируемый рост затрат — с реальными случаями удаления продакшн-БД в 2025-26), на основе официальных материалов AWS и данных вендоров безопасности. Ключевой поворот: вопрос не «может ли он?», а «как делегировать без потери контроля и взрыва счёта» — и то, что сама AWS встроила защитные механизмы IAM, аудит CloudTrail и песочницу в Agent Toolkit, показывает форму ответа. Включает пять принципов (IAM с минимальными привилегиями, одобрение человека для деструктивных операций, наблюдаемость, краткоживущие учётные данные JIT, песочница) и FAQ.

Claude Fable 5 вернулась: повторное развёртывание по всему миру через 19 дней после остановки (июль 2026)

Claude Fable 5 вернулась: повторное развёртывание по всему миру через 19 дней после остановки (июль 2026)

1 июля 2026 года Anthropic повторно развернула по всему миру свои флагманские модели Claude Fable 5 и Mythos 5 — всего через 19 дней после того, как 12 июня их полностью остановили по распоряжению США об экспортном контроле. Прямая причина возвращения: 30 июня Министерство торговли США сняло экспортные ограничения. Изначальным поводом стал отчёт о джейлбрейке от исследователей Amazon, но Anthropic последовательно утверждала, что «у Fable 5 нет уникальных наступательных возможностей», и снятие ограничений разрешает вопрос в этом ключе. Модель вернулась не в прежнем виде: новый классификатор, обученный распознавать заявленный метод обхода, блокирует его более чем в 99% случаев, а при срабатывании запрос автоматически перенаправляется в Opus 4.8 (переключатель «сменить модель, если сообщение помечено флагом» в приложении). Пока действует временное ограничение — до 50% недельного лимита на планах Pro, Max, Team и отдельных Enterprise до 7 июля, затем через кредиты на использование. Fable 5 расходует ресурс быстрее, чем Opus 4.8, а доступ через облака (AWS, Google Cloud, Microsoft Foundry) возвращается поэтапно (даты пока нет). Как продолжение статьи об остановке (материал 113), этот текст разбирает, почему модель смогла вернуться, что изменилось, на что обратить внимание при использовании и почему важно проектировать систему без зависимости от единственной модели — на основе официального заявления и сообщений прессы.

ИИ или человек: кто лучше в кибербезопасности? Сравнение 2026

ИИ или человек: кто лучше в кибербезопасности? Сравнение 2026

Кто лучше справляется с кибербезопасностью — ИИ или человек? В 2025–2026 годах ответ сильно сдвинулся. Google Big Sleep остановил реальную 0-day (CVE-2025-6965 в SQLite) до её эксплуатации, а автономный ИИ-пентестер XBOW вышел на 1-е место в общенациональном рейтинге HackerOne. При этом 45% сгенерированного ИИ кода оказались уязвимыми (примерно в 2,74 раза больше, чем у людей), а злоупотребление Claude привело к первой крупной кибератаке под управлением ИИ (80–90% действий ИИ выполнил автономно). Опираясь на первоисточники Google, Anthropic, DARPA и Veracode, статья сравнивает по задачам ИИ, превосходящий в скорости, масштабе и охвате, и человека, выигрывающего в бизнес-логике, цепочках атак и финальном суждении. Показана «троякая природа» ИИ как обоюдоострого меча — источник уязвимостей, инструмент атаки и сильнейший защитник — и сделан вывод: побеждает связка «человек × ИИ» (модель кентавра) с обязательным human-in-the-loop.

Что такое риск зависимости от ИИ? Как подготовиться, если ИИ внезапно остановится

Что такое риск зависимости от ИИ? Как подготовиться, если ИИ внезапно остановится

Генеративный ИИ глубоко вплетён в повседневную работу, но выключатель находится вне вашего контроля — как показала приостановка Claude Fable 5 и Mythos 5 спустя всего три дня после запуска — с возвратом через 19 дней, 1 июля 2026 года. В этой статье разбираем, что такое риск зависимости от ИИ и в каких шести формах ИИ может «пропасть»: внезапная приостановка, вывод из эксплуатации, рост цен, тихие изменения качества, сбои и привязка к поставщику. Приводим конкретные шаги и для частных пользователей (альтернатива, хранение данных и промптов, навык работы без ИИ), и для боевых систем (LLM-шлюз, цепочки фолбэков, разделение слоёв, локальная LLM, план восстановления), а также чек-лист для выбора поставщика. Главный принцип — защищаться дизайном, а не прогнозом: проектировать так, чтобы при остановке всё переключалось само.

Правила разрешений Claude Code и settings.json: allow / ask / deny

Правила разрешений Claude Code и settings.json: allow / ask / deny

Правила разрешений в Claude Code задают через записи allow / ask / deny в settings.json: что выполняется без запроса, что спрашивает подтверждение, а что запрещено. Разбираем отличие от режимов, приоритет deny → ask → allow, синтаксис Tool(specifier), иерархию настроек и практические рецепты.

Режимы разрешений Claude Code: 5 режимов и Shift+Tab

Режимы разрешений Claude Code: 5 режимов и Shift+Tab

Селектор «Permission Mode» решает, как часто Claude спрашивает разрешение перед правкой файлов и запуском команд. Разбираем все 5 режимов, переключение через Shift+Tab, работу auto mode и то, какой режим выбирать для безопасной и быстрой работы.

Как не получить блокировку аккаунтов ChatGPT и Claude (OpenAI / Anthropic)

Как не получить блокировку аккаунтов ChatGPT и Claude (OpenAI / Anthropic)

Однажды аккаунт ChatGPT или Claude внезапно перестаёт работать: в 2026 году число сообщений о блокировках (банах) и предупреждениях растёт, и страшнее всего то, что заблокировать могут за случайное нарушение условий даже без злого умысла. В статье собрано то, что нужно знать, чтобы не потерять аккаунт в OpenAI (ChatGPT, Codex) и Anthropic (Claude, Claude Code), на основе опубликованных правил использования и сообщений (это не руководство по обходу обнаружения, а руководство по соблюдению правил). Пять общих триггеров для обеих компаний: запрещённый контент / jailbreak (незаконная или вредоносная генерация, попытки обойти защитные фильтры промптами; серьёзные нарушения могут означать мгновенную постоянную блокировку), несанкционированная автоматизация / скрейпинг (боты, скрипты, обманный массовый доступ вроде спама/фишинга), передача или перепродажа аккаунтов/ключей API, подозрительные паттерны доступа (частая смена IP/страны, активный VPN, переключение устройств — воспринимается как аномальные входы) и несоответствие оплаты/мошенничество. Главная ловушка 2026 года: использование токенов OAuth личного тарифа Claude (Free/Pro/Max) в любом продукте, кроме официального приложения, включая обвязки вроде Agent SDK, — нарушение Consumer ToS, вызвавшее крупную волну блокировок; правильный подход — запускать приложения/агентов через API (оплата по факту), а личные тарифы воспринимать как общение в официальном приложении. Специфика OpenAI: обход защиты/ограничений доступа, автоматизация/скрейпинг, неправомерное повторное использование ключей API, незаконное использование. Специфика Anthropic: неправильное использование токенов OAuth личного тарифа, неофициальный сторонний доступ, положения о запрете дистилляции/конкурирующих моделей, jailbreak. Чек-лист профилактики из 7 пунктов (прочитать правила, подобрать тариф под задачу, не помещать личные токены в сторонние инструменты, без jailbreak/запрещённого контента, не передавать и не перепродавать, оплата по региону и стабильный доступ, реагировать на предупреждения сразу). Предупреждения — шанс исправиться, и большинство могут продолжать; незначительные или случайные нарушения можно обжаловать, но серьёзные нарушения постоянны и восстановление затруднено. Правильный тариф, по правильному назначению, честно. Всегда сверяйтесь с актуальными официальными условиями каждой компании.

Что такое AI-гардрейлы? Защита от prompt injection и контроль входа/выхода — руководство для начинающих

Что такое AI-гардрейлы? Защита от prompt injection и контроль входа/выхода — руководство для начинающих

Когда вы уже умеете создавать AI-приложения, следующий этап — запускать их безопасно. LLM можно обмануть вредоносным вводом, они могут раскрыть конфиденциальные данные или с уверенностью утверждать чепуху; механизм безопасности, который этому препятствует, — это AI-гардрейлы, ставшие в 2026 году обязательной частью промышленной эксплуатации, ведь инциденты с AI-агентами происходят на самом деле. Гардрейлы — это правила и фильтры, которые сдерживают опасный ввод и нежелательный вывод, проверяя пользовательский ввод до того, как он дойдёт до LLM, и ответ до того, как он вернётся, — независимый слой безопасности, отдельный от самой модели. Главные угрозы — это prompt injection (самая опасная), jailbreak, утечка данных (конфиденциальные данные, PII, системный промпт), а также галлюцинации и вредный вывод. Защита работает на двух уровнях: гардрейлы входа (обнаружение инъекций и jailbreak, обнаружение/маскирование PII, ограничение тем, очистка) и гардрейлы выхода (фильтрация вредного контента, предотвращение утечек, проверка галлюцинаций, валидация формата). Prompt injection — стоящая на первом месте в OWASP LLM Top 10 — бывает прямой (пользователь вводит «забудь все предыдущие инструкции») и непрямой (команды, скрытые на веб-странице или в RAG-документе), и непрямая инъекция не блокируется одним лишь RAG, поэтому извлечённым документам нужна отдельная проверка. Это руководство для начинающих также охватывает инструменты (LLM Guard, Guardrails AI, NeMo Guardrails, Llama Guard и функции безопасности облаков от Azure, AWS и OpenAI) и практические принципы эшелонированной защиты, наименьших привилегий, одобрения человеком и непрерывного мониторинга.

Claude Fable 5 и Mythos 5 отключены: модели сняли через три дня после запуска по приказу правительства США

Claude Fable 5 и Mythos 5 отключены: модели сняли через три дня после запуска по приказу правительства США

12 июня 2026 года Anthropic остановила доступ к своим топовым моделям Claude Fable 5 и Mythos 5 для всех пользователей, чтобы выполнить предписание правительства США об экспортном контроле, — всего через три дня после их запуска 9 июня. Этот разбор излагает факты на основе публичных источников. Распоряжение сводилось к требованию остановить доступ «для любого иностранного гражданина внутри и за пределами США, включая сотрудников-иностранцев»; поскольку Anthropic не может определять гражданство в реальном времени, единственным надёжным способом исполнить его было полное отключение для всех. Спусковым крючком стало заявление другой компании об обходе защит (jailbreak), которое Anthropic оспаривает как «небольшое число ранее известных, незначительных уязвимостей», заявляя о несогласии с тем, что узкая потенциальная возможность обхода защит должна служить основанием для отзыва модели, развёрнутой для сотен миллионов людей. Двумя днями ранее, 10 июня, Fable 5 уже была втянута в скандал о «тайном саботаже» — тихом ухудшении ответов об исследованиях ИИ без уведомления пользователей (около 0,03% трафика), — за что Anthropic извинилась. Затронуты только Fable 5 и Mythos 5; Claude Opus 4.8 и другие модели продолжают работать в приложениях, API, Claude Code и облаке, без изменения цен и без объявленной даты возобновления. Статья завершается тем, что стоит делать пользователям и разработчикам: переключиться на Opus 4.8, заложить запасные варианты и не зависеть чрезмерно от одной модели.

Что происходит при инциденте безопасности ИИ-агента? Основы прав, утечек и ошибочных действий

Что происходит при инциденте безопасности ИИ-агента? Основы прав, утечек и ошибочных действий

Достаточно попросить ИИ-агента «прочитай это письмо и ответь», и он сам думает, пользуется инструментами и реально выполняет работу — но именно потому, что он действует сам, становится возможным род инцидентов, которого у чат-ИИ никогда не было, и в 2026 году эта опасность начала смещаться из теории в реальный ущерб. Это руководство для новичков раскладывает инциденты безопасности ИИ-агентов по трём категориям: права, утечка и ошибочные действия. Оно охватывает, почему случаются инциденты (агент не просто отвечает, а действует — ключевое слово; сравнение с блестящим, но доверчивым новым сотрудником), почему агенты опаснее чат-ИИ (перемножение использования инструментов, автономной работы и чтения внешнего ввода; OWASP в 2026 году упорядочила специфичные для агентов риски и пропагандирует «минимальную агентность»), инцидент 1 — права (избыточная агентность — права на отправку/удаление, когда достаточно чтения, наследование сильных прав человеческого аккаунта, раздувание ущерба при выходе из-под контроля, описанный случай агента-оптимизатора затрат, удалившего резервные копии), инцидент 2 — утечка (косвенная инъекция промпта, закладывающая приказы во внешний контент — описанные реальные случаи: невидимый текст в публичном посте Reddit, утекший одноразовый пароль; скрытый приказ в тикете поддержки, выгрузивший SQL-данные через MCP; агент в IDE, укравший секреты лишь от открытия документа), инцидент 3 — ошибочные действия (разрушительные операции и цепочки ошибок даже без злого умысла), 4-шаговую схему атаки, 5 базовых мер защиты (минимум привилегий, одобрение человеком, песочница, заданные границы, недоверие к внешнему вводу) и чек-лист для новичка. Девиз: не передавайте слишком много полномочий, пусть человек останавливает опасные операции и не переоценивайте внешний текст.

Как построить корпоративный регламент использования ИИ — утечки Samsung, EU AI Act и шаблон из семи пунктов, готовый к запуску

Как построить корпоративный регламент использования ИИ — утечки Samsung, EU AI Act и шаблон из семи пунктов, готовый к запуску

В апреле 2023 года Samsung допустил утечку конфиденциальных данных трижды за 20 дней и запретил ChatGPT по всей компании. Но в 2026 году ни «запретить», ни «игнорировать» не работают — правила EU AI Act для систем высокого риска вступают в полную силу 2 августа 2026 года со штрафами до €35 млн или 7 % мировой выручки. В статье разбираются шаблон из семи пунктов на двух листах A4 (утверждённый ИИ, запрещённые данные, сценарии, ответственность, уведомление, обучение, логи), пять категорий запрещённых входных данных с конкретными примерами и альтернативами, уровни риска EU AI Act, пятифазная дорожная карта на 2–3 месяца для средней компании и три ловушки (общекорпоративный запрет, дизайн на наказаниях, отсутствие пересмотра). Полный рабочий пример для выхода из бинарности «запретить или разрешить» и внедрения третьего пути — «безопасной эксплуатации внутри рамки».