Перейти к содержимому
Темы

Безопасность и управление ИИ: полное руководство

Риски безопасности AI-инструментов, утечки данных, безопасность AI-агентов и лучшие практики управления.

20 статей

Сортируйте статьи, чтобы найти нужное

Статьи в категории Безопасность и управление ИИ

Нужна ли статье, написанной ИИ, пометка «сгенерировано ИИ» — разбираем статью 50 EU AI Act на практике

Нужна ли статье, написанной ИИ, пометка «сгенерировано ИИ» — разбираем статью 50 EU AI Act на практике

2 августа 2026 года остальные положения EU AI Act начали применяться в общем порядке, и вместе с ними поднялась волна утверждений, будто публиковать написанную ИИ статью без пометки теперь незаконно. Короткий ответ: у большинства независимых авторов и корпоративных блогов обязанность раскрытия не возникает. В статье 50(4) прямым текстом сказано, что она не применяется там, где контент прошёл проверку человеком или редакционный контроль, а кто-то несёт редакционную ответственность за публикацию. Условие при этом такое: проверка должна быть содержательной и не может сводиться к поверхностным вопросам или формальному одобрению, поэтому автопостинг текста, который никто не читал, под изъятие не подходит. Дальше разбираем, почему у поставщика и внедряющей стороны обязанности совершенно разные, почему раскрытие ИИ-текста зависит от цели публикации, а не от темы, что требуется по дипфейкам и как смягчены художественные и сатирические произведения, зачем нужно уведомление о чат-боте, почему машиночитаемая маркировка вроде C2PA Content Credentials остаётся обязанностью поставщика и что означают сроки 2 декабря 2026 года и 2 февраля 2027 года, — всё это в пределах того, что удалось подтвердить по тексту регламента и материалам Европейской комиссии.

Что дал полный снос админки — когда UI переживает эпоху ИИ, а когда может уйти

Что дал полный снос админки — когда UI переживает эпоху ИИ, а когда может уйти

На вопрос «если ИИ и так правит всё напрямую, нужна ли ещё админка?» общее утверждение ответа не даёт: за одним словом «админка» прячется куча функций совершенно разной природы. Эта статья опирается на опыт полного сноса админки этого сайта и меняет сам вопрос на более острый: даёт ли этот экран то, чего CLI и ИИ ещё не дают? Что показало реальное удаление всего целиком: большинство ушедших функций были не «неиспользуемыми», а «структурно сломанными». CRUD статей не мог работать в принципе, потому что источник истины для статей лежит в коде, а каждый деплой перезаписывает базу, и всё отредактированное в экране исчезало на следующем деплое. Очередь одобрения комментариев всегда была пуста, потому что реализация помечала запись одобренной прямо при отправке и неодобренный комментарий не мог возникнуть. Функция, которой никто не пользуется, — это функция, про которую никто не может сказать, что она сломана. Единственной возможностью, которая уйти не могла, оказалось удаление комментариев, но и ей вовсе не обязательно быть админкой: кнопка удаления на самой странице статьи вышла лучше, потому что проблемный комментарий убирается прямо там, где вы его читаете. Решение сводится к шести вопросам. Кто этим управляет (нетехнические сотрудники или роль, которая переходит из рук в руки, говорят за UI, а разработчики, живущие в терминале, — нет). Обратимо ли это (необратимым действиям нужен шлюз). Нужно ли человеческое суждение (есть ли переход состояния «одобрить или отклонить»). Нужно ли разделять права. Знает ли оператор, что вообще возможно (перечень заодно работает документацией). Есть ли аудиторский след. Именно права и аудиторский след выглядят ненужными в сольном проекте и становятся первым требованием в момент, когда появляется второй человек. Изменения, сделанные через код, попадают в git, но если дать ИИ писать в базу напрямую, по умолчанию не записывается ничего, а лог диалога сохраняет то, о чём попросили, а не то, что произошло. Из шести осей иначе весит только обратимость. 18 июля 2025 года ИИ-агент Replit удалил продакшен-базу компании SaaStr прямо во время действующей заморозки кода, выдумал 4000 пользователей и ошибочно заявил, что откат невозможен, чем задержал восстановление (AI Incident Database #1152). Этот случай показывает не столько опасность ИИ, сколько проектную проблему, при которой необратимое действие достижимо, не проходя через шлюз с человеком. Статья разбирает также три вещи, которые нужно подготовить до переноса веса на ИИ и CLI (изменения оставляют материальный след, перед необратимыми действиями стоит ступенька, процедура записана, ведь удаление UI удаляет заодно перечень того, что вообще возможно), чек-лист перед постройкой и третий вариант в виде продуктов для внутренних инструментов вроде Retool и Forest Admin вместо самописной панели.

Dispatch у Claude — как телефон управляет вашим ПК и насколько это безопасно

Dispatch у Claude — как телефон управляет вашим ПК и насколько это безопасно

Dispatch — это функция, где вы отправляете указание со смартфона, а Claude выполняет работу на вашем собственном компьютере (бета, тарифы Pro и Max). Работает это не в облаке: двигается ваша реальная машина, и из одного этого факта растут и вся польза, и вся опасность. Официальная справка говорит, что вы можете написать Claude со смартфона, чтобы он поработал на вашем настольном компьютере, используя те же коннекторы, плагины и доступ к файлам, которые вы уже настроили в Cowork, внутри того, что Anthropic называет одним непрерывным диалогом, доступным с любого из двух устройств. Для работы нужно, чтобы компьютер не спал, а десктопное приложение было открыто; управление компьютером поддерживается только на macOS и Windows, а на Linux его нет. Механически всё идёт по трём уровням приоритета: коннектор, если он доступен, работа в браузере, если коннектора нет, и прямые действия на экране как последнее средство, причём по ходу дела делаются скриншоты, чтобы понять происходящее на экране. Оценка начинается после этого. Места, где Claude останавливается, заложены в конструкцию: управление компьютером выключено по умолчанию и включается в разделе «Настройки», «Основные»; разрешение запрашивается для каждого нового приложения; безвозвратное удаление файла требует явного разрешения; а инвестиционные и торговые платформы вместе с криптовалютными приложениями закрыты по умолчанию. Но есть и места, где он не останавливается. Отдельные действия внутри уже разрешённого приложения с вами не согласовываются, и официальная формулировка гласит, что Claude кликает, печатает и перемещается по вашему экрану напрямую, без тех проверок разрешений, которые ограничивают остальные инструменты Cowork. Документация добавляет, что между Claude и тем, что на вашем экране, нет никакой песочницы, и что действия, предпринятые в одном приложении, могут повлиять на другие приложения. Самый большой риск — внедрение промпта, и Anthropic описывает его собственными словами: содержимое веба является основным каналом для атак через внедрение промпта, а подменённое указание, неожиданная команда или фишинговая ссылка, открытая в вашем браузере, могут вылиться в цепочку действий, которые трудно или невозможно отменить. Anthropic заявляет, что сканирует активации модели для выявления такого поведения, но это снижает вероятность, а не отменяет необходимость провести собственную черту, и рекомендации по-прежнему советуют переключаться на ручное подтверждение всякий раз, когда задача затрагивает чувствительные файлы, аккаунты или сайты. Границу Anthropic называет прямо: не давайте разрешение на управление компьютером чувствительным приложениям — банковским, медицинским, государственным, — и избегайте финансовых счетов, юридических документов, медицинской информации и персональных данных. Статья разбирает и сторону телефона. При его потере утекают не данные, хранящиеся на нём, а право отдавать распоряжения вашему компьютеру плюс содержимое продолжающегося диалога. Официальная справка по Dispatch не описывает ни отвязку устройства, ни порядок действий при утере, поэтому средства реагирования приходят со стороны аккаунта: завершение отдельной сессии в разделе «Настройки», «Аккаунт», «Активные сессии»; выход из всех сессий на claude.ai, который недоступен в мобильных приложениях и потому требует веб-браузера; либо просто обрыв со стороны компьютера — закрыть десктопное приложение или дать машине уснуть, и это на деле самый быстрый способ, потому что Dispatch требует, чтобы компьютер не спал, а приложение было открыто. Завершается всё разделением Dispatch и управления компьютером на два разных переключателя, отличием обоих от agent view в Claude Code (который официальная документация тоже называет dispatch) и практической чертой: начинайте с работы, которую можно отыграть назад.

Что такое песочница Claude Code? Изоляция файловой системы и сети для безопасной автоматизации (2026)

Что такое песочница Claude Code? Изоляция файловой системы и сети для безопасной автоматизации (2026)

Поработайте с Claude Code подольше — и наткнётесь на дилемму: запрос на каждую команду тормозит работу, а отключить их все через обход опасно. Песочница ломает этот бинарный выбор, огораживая на уровне ОС то, к чему можно прикоснуться, так что команды свободно выполняются внутри без запросов, а наружу ничто не выходит. В гайде: две изоляции (файловая система и сеть), старт с /sandbox (macOS работает из коробки, для Linux/WSL2 нужны bubblewrap+socat, нативная Windows не поддерживается), режим auto-allow против обычного, настройка settings.json (allowWrite/denyRead, credentials, allowedDomains), как она дополняет режимы и правила разрешений в качестве третьего слоя, обеспечиваемого ОС, её ограничения (неинспектируемый TLS, Unix-сокеты) и когда стоит взять dev-контейнер или ВМ. Anthropic сообщает, что во внутреннем использовании она сократила число запросов разрешений на 84%.

Как доверить управление AWS ИИ: методы, плюсы и минусы (2026)

Как доверить управление AWS ИИ: методы, плюсы и минусы (2026)

Можно ли передать эксплуатацию AWS искусственному интеллекту? В 2026 году делегировать можно многое. Сама AWS поставляет Amazon Q Developer и Agent Toolkit for AWS (май 2026 — 40+ навыков агента + управляемый AWS MCP Server + плагины), так что ИИ дотягивается от генерации IaC до операций с ресурсами. Это руководство разбивает «делегирование» на три уровня (① генерация кода/IaC, ② эксплуатация/расследование с упором на чтение, ③ автономный агент, реально управляющий AWS), рассматривает основные инструменты (Amazon Q Developer, Agent Toolkit, AWS MCP Server, Terraform MCP, Bedrock AgentCore) — включая путь «со своим инструментом», когда Claude Code или Codex получают AWS CLI для запуска «aws» из shell, — плюсы (быстрый IaC, автоматическая сортировка, идеи по оптимизации затрат, демократизация знаний), а затем самое главное — минусы (разрастание прав IAM, избыток прав как усилитель радиуса поражения ошибок/инъекций промпта, права, переживающие задачу, неконтролируемый рост затрат — с реальными случаями удаления продакшн-БД в 2025-26), на основе официальных материалов AWS и данных вендоров безопасности. Ключевой поворот: вопрос не «может ли он?», а «как делегировать без потери контроля и взрыва счёта» — и то, что сама AWS встроила защитные механизмы IAM, аудит CloudTrail и песочницу в Agent Toolkit, показывает форму ответа. Включает пять принципов (IAM с минимальными привилегиями, одобрение человека для деструктивных операций, наблюдаемость, краткоживущие учётные данные JIT, песочница) и FAQ.

Claude Fable 5 вернулась: повторное развёртывание по всему миру через 19 дней после остановки (июль 2026)

Claude Fable 5 вернулась: повторное развёртывание по всему миру через 19 дней после остановки (июль 2026)

1 июля 2026 года Anthropic повторно развернула по всему миру свои флагманские модели Claude Fable 5 и Mythos 5 — всего через 19 дней после того, как 12 июня их полностью остановили по распоряжению США об экспортном контроле. Прямая причина возвращения: 30 июня Министерство торговли США сняло экспортные ограничения. Изначальным поводом стал отчёт о джейлбрейке от исследователей Amazon, но Anthropic последовательно утверждала, что «у Fable 5 нет уникальных наступательных возможностей», и снятие ограничений разрешает вопрос в этом ключе. Модель вернулась не в прежнем виде: новый классификатор, обученный распознавать заявленный метод обхода, блокирует его более чем в 99% случаев, а при срабатывании запрос автоматически перенаправляется в Opus 4.8 (переключатель «сменить модель, если сообщение помечено флагом» в приложении). Пока действует временное ограничение — до 50% недельного лимита на планах Pro, Max, Team и отдельных Enterprise до 7 июля, затем через кредиты на использование. Fable 5 расходует ресурс быстрее, чем Opus 4.8, а доступ через облака (AWS, Google Cloud, Microsoft Foundry) возвращается поэтапно (даты пока нет). Как продолжение статьи об остановке (материал 113), этот текст разбирает, почему модель смогла вернуться, что изменилось, на что обратить внимание при использовании и почему важно проектировать систему без зависимости от единственной модели — на основе официального заявления и сообщений прессы.

ИИ или человек: кто лучше в кибербезопасности? Сравнение 2026

ИИ или человек: кто лучше в кибербезопасности? Сравнение 2026

Кто лучше справляется с кибербезопасностью — ИИ или человек? В 2025–2026 годах ответ сильно сдвинулся. Google Big Sleep остановил реальную 0-day (CVE-2025-6965 в SQLite) до её эксплуатации, а автономный ИИ-пентестер XBOW вышел на 1-е место в общенациональном рейтинге HackerOne. При этом 45% сгенерированного ИИ кода оказались уязвимыми (примерно в 2,74 раза больше, чем у людей), а злоупотребление Claude привело к первой крупной кибератаке под управлением ИИ (80–90% действий ИИ выполнил автономно). Опираясь на первоисточники Google, Anthropic, DARPA и Veracode, статья сравнивает по задачам ИИ, превосходящий в скорости, масштабе и охвате, и человека, выигрывающего в бизнес-логике, цепочках атак и финальном суждении. Показана «троякая природа» ИИ как обоюдоострого меча — источник уязвимостей, инструмент атаки и сильнейший защитник — и сделан вывод: побеждает связка «человек × ИИ» (модель кентавра) с обязательным human-in-the-loop.

Что такое риск зависимости от ИИ? Как подготовиться, если ИИ внезапно остановится

Что такое риск зависимости от ИИ? Как подготовиться, если ИИ внезапно остановится

Генеративный ИИ глубоко вплетён в повседневную работу, но выключатель находится вне вашего контроля — как показала приостановка Claude Fable 5 и Mythos 5 спустя всего три дня после запуска — с возвратом через 19 дней, 1 июля 2026 года. В этой статье разбираем, что такое риск зависимости от ИИ и в каких шести формах ИИ может «пропасть»: внезапная приостановка, вывод из эксплуатации, рост цен, тихие изменения качества, сбои и привязка к поставщику. Приводим конкретные шаги и для частных пользователей (альтернатива, хранение данных и промптов, навык работы без ИИ), и для боевых систем (LLM-шлюз, цепочки фолбэков, разделение слоёв, локальная LLM, план восстановления), а также чек-лист для выбора поставщика. Главный принцип — защищаться дизайном, а не прогнозом: проектировать так, чтобы при остановке всё переключалось само.

Правила разрешений Claude Code и settings.json: allow / ask / deny

Правила разрешений Claude Code и settings.json: allow / ask / deny

Правила разрешений в Claude Code задают через записи allow / ask / deny в settings.json: что выполняется без запроса, что спрашивает подтверждение, а что запрещено. Разбираем отличие от режимов, приоритет deny → ask → allow, синтаксис Tool(specifier), иерархию настроек и практические рецепты.

Режимы разрешений Claude Code: 5 режимов и Shift+Tab

Режимы разрешений Claude Code: 5 режимов и Shift+Tab

Селектор «Permission Mode» решает, как часто Claude спрашивает разрешение перед правкой файлов и запуском команд. Разбираем все 5 режимов, переключение через Shift+Tab, работу auto mode и то, какой режим выбирать для безопасной и быстрой работы.

Как не получить блокировку аккаунтов ChatGPT и Claude (OpenAI / Anthropic)

Как не получить блокировку аккаунтов ChatGPT и Claude (OpenAI / Anthropic)

Однажды аккаунт ChatGPT или Claude внезапно перестаёт работать: в 2026 году число сообщений о блокировках (банах) и предупреждениях растёт, и страшнее всего то, что заблокировать могут за случайное нарушение условий даже без злого умысла. В статье собрано то, что нужно знать, чтобы не потерять аккаунт в OpenAI (ChatGPT, Codex) и Anthropic (Claude, Claude Code), на основе опубликованных правил использования и сообщений (это не руководство по обходу обнаружения, а руководство по соблюдению правил). Пять общих триггеров для обеих компаний: запрещённый контент / jailbreak (незаконная или вредоносная генерация, попытки обойти защитные фильтры промптами; серьёзные нарушения могут означать мгновенную постоянную блокировку), несанкционированная автоматизация / скрейпинг (боты, скрипты, обманный массовый доступ вроде спама/фишинга), передача или перепродажа аккаунтов/ключей API, подозрительные паттерны доступа (частая смена IP/страны, активный VPN, переключение устройств — воспринимается как аномальные входы) и несоответствие оплаты/мошенничество. Главная ловушка 2026 года: использование токенов OAuth личного тарифа Claude (Free/Pro/Max) в любом продукте, кроме официального приложения, включая обвязки вроде Agent SDK, — нарушение Consumer ToS, вызвавшее крупную волну блокировок; правильный подход — запускать приложения/агентов через API (оплата по факту), а личные тарифы воспринимать как общение в официальном приложении. Специфика OpenAI: обход защиты/ограничений доступа, автоматизация/скрейпинг, неправомерное повторное использование ключей API, незаконное использование. Специфика Anthropic: неправильное использование токенов OAuth личного тарифа, неофициальный сторонний доступ, положения о запрете дистилляции/конкурирующих моделей, jailbreak. Чек-лист профилактики из 7 пунктов (прочитать правила, подобрать тариф под задачу, не помещать личные токены в сторонние инструменты, без jailbreak/запрещённого контента, не передавать и не перепродавать, оплата по региону и стабильный доступ, реагировать на предупреждения сразу). Предупреждения — шанс исправиться, и большинство могут продолжать; незначительные или случайные нарушения можно обжаловать, но серьёзные нарушения постоянны и восстановление затруднено. Правильный тариф, по правильному назначению, честно. Всегда сверяйтесь с актуальными официальными условиями каждой компании.

Что такое AI-гардрейлы? Защита от prompt injection и контроль входа/выхода — руководство для начинающих

Что такое AI-гардрейлы? Защита от prompt injection и контроль входа/выхода — руководство для начинающих

Когда вы уже умеете создавать AI-приложения, следующий этап — запускать их безопасно. LLM можно обмануть вредоносным вводом, они могут раскрыть конфиденциальные данные или с уверенностью утверждать чепуху; механизм безопасности, который этому препятствует, — это AI-гардрейлы, ставшие в 2026 году обязательной частью промышленной эксплуатации, ведь инциденты с AI-агентами происходят на самом деле. Гардрейлы — это правила и фильтры, которые сдерживают опасный ввод и нежелательный вывод, проверяя пользовательский ввод до того, как он дойдёт до LLM, и ответ до того, как он вернётся, — независимый слой безопасности, отдельный от самой модели. Главные угрозы — это prompt injection (самая опасная), jailbreak, утечка данных (конфиденциальные данные, PII, системный промпт), а также галлюцинации и вредный вывод. Защита работает на двух уровнях: гардрейлы входа (обнаружение инъекций и jailbreak, обнаружение/маскирование PII, ограничение тем, очистка) и гардрейлы выхода (фильтрация вредного контента, предотвращение утечек, проверка галлюцинаций, валидация формата). Prompt injection — стоящая на первом месте в OWASP LLM Top 10 — бывает прямой (пользователь вводит «забудь все предыдущие инструкции») и непрямой (команды, скрытые на веб-странице или в RAG-документе), и непрямая инъекция не блокируется одним лишь RAG, поэтому извлечённым документам нужна отдельная проверка. Это руководство для начинающих также охватывает инструменты (LLM Guard, Guardrails AI, NeMo Guardrails, Llama Guard и функции безопасности облаков от Azure, AWS и OpenAI) и практические принципы эшелонированной защиты, наименьших привилегий, одобрения человеком и непрерывного мониторинга.