Перейти к содержимому

Руководства, сравнения и новости об инструментах ИИ

Руководства, сравнения и новости об инструментах ИИ для начинающих

Рекомендуемая статья

Codex «thread not found»: диагностика и пример восстановления
Codex AI-разработка

Codex «thread not found»: диагностика и пример восстановления

Ошибка Codex «thread not found» возможна даже при читаемой истории. Схемы показывают различие сохранённых данных и беседы, загруженной для выполнения, а журналы случая на Windows — успешную отправку после повторной загрузки. Рассмотрены повторное открытие, перезапуск, короткая проверка, а также исследование только на чтение и перенос работы, если проблема остаётся. Открытые контрпримеры показывают, почему нельзя говорить об универсальном решении; конкретный выпуск, устраняющий проблему, мы не подтвердили.

Последние статьи

214 статей
Фреймворки ИИ-агентов, сравнение 2026: LangGraph, CrewAI, AutoGen, OpenAI, Google, Claude — что выбрать?

Фреймворки ИИ-агентов, сравнение 2026: LangGraph, CrewAI, AutoGen, OpenAI, Google, Claude — что выбрать?

Первое препятствие при встраивании ИИ-агента в реальную работу — «на каком фреймворке его собирать». С точки зрения разработчика и того, кто выбирает технологии, статья сравнивает шесть главных фреймворков — LangGraph, CrewAI, AutoGen (вошедший в Microsoft Agent Framework, GA апрель 2026), OpenAI Agents SDK, Google ADK и Claude Agent SDK — по подходу к оркестрации (ориентированный граф / ролевая команда / диалоговый GroupChat / передачи управления / иерархическое дерево / автономный цикл инструментов), языку, кривой обучения, управляемости, зрелости для прода, стоимости токенов и наиболее подходящему сценарию. Ключевая оговорка: фреймворк, «быстрейший для прототипа» (CrewAI), может оказаться самым дорогим в проде — около 3× токенов (41k против 18.5k у LangGraph в одном бенчмарке) и недетерминированный, что плохо подходит для финансов и здравоохранения. Также объясняется, как 2026 год принёс интероперабельность через MCP (инструменты) и A2A (агент-агент), так что агенты из разных фреймворков теперь работают вместе, а привязка ослабла. Включает гид по выбору под задачу и FAQ.

ИИ или человек: кто лучше в кибербезопасности? Сравнение 2026

ИИ или человек: кто лучше в кибербезопасности? Сравнение 2026

Кто лучше справляется с кибербезопасностью — ИИ или человек? В 2025–2026 годах ответ сильно сдвинулся. Google Big Sleep остановил реальную 0-day (CVE-2025-6965 в SQLite) до её эксплуатации, а автономный ИИ-пентестер XBOW вышел на 1-е место в общенациональном рейтинге HackerOne. При этом 45% сгенерированного ИИ кода оказались уязвимыми (примерно в 2,74 раза больше, чем у людей), а злоупотребление Claude привело к первой крупной кибератаке под управлением ИИ (80–90% действий ИИ выполнил автономно). Опираясь на первоисточники Google, Anthropic, DARPA и Veracode, статья сравнивает по задачам ИИ, превосходящий в скорости, масштабе и охвате, и человека, выигрывающего в бизнес-логике, цепочках атак и финальном суждении. Показана «троякая природа» ИИ как обоюдоострого меча — источник уязвимостей, инструмент атаки и сильнейший защитник — и сделан вывод: побеждает связка «человек × ИИ» (модель кентавра) с обязательным human-in-the-loop.

Полное руководство по Ollama: запуск локальных LLM одной командой [2026]

Полное руководство по Ollama: запуск локальных LLM одной командой [2026]

Ollama — стандартный инструмент с открытым исходным кодом для запуска локальных LLM, который берёт на себя почти всю утомительную настройку и позволяет скачать модель и начать диалог одной командой. В этом руководстве для новичков мы разберём весь путь от начала до конца: установку на Windows, Mac и Linux, основные команды, выбор моделей по размеру и VRAM, добавление GUI вроде Open WebUI, использование локального и совместимого с OpenAI API для встраивания в приложения, настройку через Modelfile и переменные окружения, а также решение типичных проблем.

Лучшие локальные LLM 2026: сравнение моделей (Qwen, Llama, DeepSeek и др.)

Лучшие локальные LLM 2026: сравнение моделей (Qwen, Llama, DeepSeek и др.)

Какую локальную LLM поставить первой? В статье разобраны основные семейства моделей 2026 года — Qwen, Llama, Gemma, DeepSeek, Mistral, Phi — по разработчику, стране происхождения, сценарию, размеру и лицензии, чтобы помочь выбрать модель под ваш ПК и задачи. Отдельный раздел посвящён русскоязычным и локальным моделям: мультиязычные Qwen и Llama с сильным русским, открытые проекты Saiga, Vikhr и T-lite / T-pro от Т-Банка, а также пояснение, почему YandexGPT и GigaChat — это в основном облачные API, а не локальные модели с открытыми весами.

Сколько VRAM нужно для локальной LLM: гайд по железу [2026]

Сколько VRAM нужно для локальной LLM: гайд по железу [2026]

Запустится ли локальная LLM на вашем ПК, на 90% решает VRAM — память GPU. В этой статье собраны быстрая таблица требуемого VRAM по размеру модели (7B, 13B, 32B, 70B) и простая формула расчёта, разобрано влияние квантизации (FP16/Q8/Q4) и ловушка с KV-кэшем, который растёт вместе с длиной контекста. Приведены реалистичные скорости для RTX 3060/4090/5090 и Mac, а также рекомендуемые сборки по трём бюджетным уровням, чтобы новичок сразу понял, что покупать.

Локальная LLM vs облачная: различия и разрыв в качестве [2026]

Локальная LLM vs облачная: различия и разрыв в качестве [2026]

Локальная LLM на вашем ПК против облачных Claude, ChatGPT и Gemini — оба «LLM», но различаются по качеству, стоимости, приватности и усилиям. Эта статья ставит их рядом в одном сравнении и честно показывает, насколько по состоянию на 2026 год сократился часто неправильно понимаемый «разрыв в качестве». Затем она подскажет, что выбрать под вашу задачу, разбирая железо для разных размеров моделей и точку безубыточности по стоимости. Для большинства людей ответ — гибрид: повседневная работа локально, самые сложные части в облаке.

Что такое риск зависимости от ИИ? Как подготовиться, если ИИ внезапно остановится

Что такое риск зависимости от ИИ? Как подготовиться, если ИИ внезапно остановится

Генеративный ИИ глубоко вплетён в повседневную работу, но выключатель находится вне вашего контроля — как показала приостановка Claude Fable 5 и Mythos 5 спустя всего три дня после запуска — с возвратом через 19 дней, 1 июля 2026 года. В этой статье разбираем, что такое риск зависимости от ИИ и в каких шести формах ИИ может «пропасть»: внезапная приостановка, вывод из эксплуатации, рост цен, тихие изменения качества, сбои и привязка к поставщику. Приводим конкретные шаги и для частных пользователей (альтернатива, хранение данных и промптов, навык работы без ИИ), и для боевых систем (LLM-шлюз, цепочки фолбэков, разделение слоёв, локальная LLM, план восстановления), а также чек-лист для выбора поставщика. Главный принцип — защищаться дизайном, а не прогнозом: проектировать так, чтобы при остановке всё переключалось само.

Правила разрешений Claude Code и settings.json: allow / ask / deny

Правила разрешений Claude Code и settings.json: allow / ask / deny

Правила разрешений в Claude Code задают через записи allow / ask / deny в settings.json: что выполняется без запроса, что спрашивает подтверждение, а что запрещено. Разбираем отличие от режимов, приоритет deny → ask → allow, синтаксис Tool(specifier), иерархию настроек и практические рецепты.

Режимы разрешений Claude Code: 5 режимов и Shift+Tab

Режимы разрешений Claude Code: 5 режимов и Shift+Tab

Селектор «Permission Mode» решает, как часто Claude спрашивает разрешение перед правкой файлов и запуском команд. Разбираем все 5 режимов, переключение через Shift+Tab, работу auto mode и то, какой режим выбирать для безопасной и быстрой работы.

Настройка effort в Claude Code: уровни и Ultracode простыми словами

Настройка effort в Claude Code: уровни и Ultracode простыми словами

Регулятор «Faster ↔ Smarter» в Claude Code задаёт, сколько токенов модель тратит на ответ. У effort 5 уровней (low–max), а ползунок добавляет режим Ultracode — итого 6 пунктов. Разбираем, почему «Extra» = xhigh (а не максимум), как настроить через /effort и какой уровень выбирать.

Что такое Agent Evals? Измеряем и результат, и trajectory

Что такое Agent Evals? Измеряем и результат, и trajectory

Agent Evals — это процесс систематического измерения того, способен ли агент, который использует инструменты и делает несколько шагов к цели, действительно выполнять свои задачи. Это эволюция LLM evals, расширяющая объект оценки с «одного вывода» до «последовательности действий». Поскольку агент планирует, вызывает инструменты и обновляет состояние, одного финального вывода недостаточно; Google отмечает, что нужно понимать «почему» за действиями агента, и делит оценку на финальный ответ и trajectory. Пять измерений: outcome (успех задачи, судят по финальному состоянию — существует ли бронь в DB, а не по высказыванию «я забронировал»), trajectory (разумные шаги, правильные инструменты в правильном порядке), корректность использования инструментов (правильный инструмент и аргументы, проверка имён функций и типов), эффективность (шаги, токены, стоимость, задержка — часто сигналы observability, привнесённые в оценку) и качество финального ответа (через LLM-as-judge или рубрику). Грейдеры — это код (быстрый/дешёвый/воспроизводимый, но хрупкий), LLM-as-judge (гибкий, но недетерминированный и требует калибровки) и человек (золотой стандарт, но дорогой — избегайте по возможности). Anthropic рекомендует оценивать результат, а не путь: механическое сопоставление trajectory «слишком жёсткое и хрупкое», поскольку агенты находят допустимые альтернативы, тогда как Google и Microsoft предлагают метрики сопоставления trajectory для диагностики провалов. Уникальные подводные камни — недетерминированность (pass^k), накапливающиеся ошибки (p^t), reward hacking (роботизированная рука DeepMind, имитирующая захват) и устаревшие или загрязнённые наборы eval. Практический приём, по Anthropic: превратить 20–50 продакшен-провалов в тест-кейсы, запустить автоматическую оценку в CI, разделить capability и regression evals и писать их рано. Бенчмарки вроде SWE-bench, tau-bench, WebArena, GAIA, OSWorld и BFCL полезны как референсы (оценки меняются от версии, поэтому не принимайте их за чистую монету). На основе официальной информации, с пометкой неопределённостей.

Что такое хуки Claude Code? Запуск shell-команд детерминированно

Что такое хуки Claude Code? Запуск shell-команд детерминированно

Хуки Claude Code — это определяемые пользователем shell-команды, которые автоматически запускаются в определённых точках жизненного цикла Claude Code, делая «это должно происходить всегда» реальным и детерминированным, не полагаясь на усмотрение LLM. Классических событий девять — SessionStart, UserPromptSubmit, PreToolUse, PostToolUse, Notification, Stop, SubagentStop, SessionEnd, PreCompact — из которых PreToolUse и другие могут блокировать (останавливая правки защищённых файлов или опасные команды). Настраиваете вы их в settings.json под ключом «hooks» как имя события -> matcher -> type + command. Контракт ввода/вывода: хук получает JSON на stdin (session_id, tool_input и т. д.) и возвращает результат через код выхода 0 (успех) / 2 (блок, со stderr, переданным обратно Claude) или структурированный JSON (continue, decision:block, permissionDecision: deny/allow/ask). Ключевой принцип: «хуки могут ужесточать, но не ослаблять ограничения» (deny всегда побеждает, блокирует даже при bypassPermissions). Классические сценарии: автоформат после правок (PostToolUse + Edit|Write), защита критичных файлов, остановка опасных команд, повторное внедрение контекста (SessionStart), уведомления/аудит и тесты перед остановкой (Stop). О безопасности: хуки выполняют произвольные shell-команды с вашими правами, поэтому настраивайте только доверенные и проверяйте/заключайте в кавычки входные данные; конфигурация хуков фиксируется при старте сессии (защитная функция), поэтому изменения в середине сессии не применяются. На основе официальной документации, с опорой на девять классических событий и контракт ввода/вывода.

Обзор по категориям

Stable Diffusion

Смотреть все

Другие ИИ

Смотреть все

Для начинающих

Смотреть все

AI-разработка

Смотреть все

Среда разработки и инфраструктура

Смотреть все

AI-агенты и автоматизация

Смотреть все

Эффективность работы

Смотреть все

Анализ данных

Смотреть все

Обучение

Смотреть все

Заработок и монетизация

Смотреть все

Разработка игр

Смотреть все

Безопасность и управление ИИ

Смотреть все

Риски и влияние ИИ

Смотреть все

Инди-разработка

Смотреть все