Перейти к содержимому
Темы

AI-разработка и программирование: создаём приложения

Разрабатывайте эффективнее с ИИ. Генерация кода, создание приложений, отладка и автоматизация.

84 статей

Сортируйте статьи, чтобы найти нужное

Статьи в категории AI-разработка

Evals для ИИ-агентов: 5 способов измерить качество (2026)

Evals для ИИ-агентов: 5 способов измерить качество (2026)

Построив ИИ-агента, вы всегда упираетесь в одну стену: «Хорошо, но он вообще работает?» Механизм, позволяющий решить, стало от изменения промпта или модели лучше или хуже на основе данных, а не интуиции, — это evals. LLM выдают разный результат каждый раз для одного и того же ввода, поэтому юнит-тесты на точное совпадение не подходят. Эта статья рассказывает, что такое evals, о пяти способах измерить качество (① сверка с эталоном ② проверки по правилам ③ LLM-as-judge ④ регрессионное тестирование ⑤ мониторинг в продакшене), об оценке, специфичной для агентов (доля успешных задач, корректные вызовы инструментов, траектория, стоимость), о том, как начать с малого с 20 примеров отказов, о частых ловушках и ключевых инструментах (Anthropic Console/Evals, OpenAI Evals, LangSmith, Langfuse, Ragas) — она написана для практиков.

ИИ-агенты против RPA: в чём разница и что когда выбирать (2026)

ИИ-агенты против RPA: в чём разница и что когда выбирать (2026)

Извечный вопрос автоматизации: «ИИ-агенты или RPA?» Ответ — не «или — или»: выбирайте по роли, а выигрышный паттерн 2026 года — гибрид обоих. RPA — детерминированные «руки», которые быстро и точно выполняют фиксированную процедуру (но ломаются при изменении экрана/спецификации); ИИ-агент — вероятностный «мозг», который считывает ситуацию и принимает решение (силён в неоднозначности и исключениях, но результат не одинаков каждый раз). В статье: разница в принципе действия, сравнительная таблица (компромисс воспроизводимости и устойчивости к изменениям), как выбрать (ось — «можно ли полностью описать правилами?»: да → RPA, суждение, которое не описать → ИИ-агент), тренд 2026 года (лидеры RPA — UiPath, Automation Anywhere, Blue Prism — становятся агентными; сближение; вопрос уже не «что из двух», а «где живёт рассуждение» = оркестрация прежде всего) и практический ответ: гибрид, где мозг (ИИ-агент) отвечает за суждение/оркестрацию, а руки (RPA) выполняют детерминированное исполнение — не ставьте агента туда, где нужна детерминированность, а делегированное суждение сочетайте с ограждениями и согласованием человеком. На основе официальной информации вендоров, с FAQ.

Claude Fable 5 против Opus 5: что и когда использовать? Практическое руководство

Claude Fable 5 против Opus 5: что и когда использовать? Практическое руководство

Claude Fable 5 и Opus 5 — обе модели верхнего эшелона, но ответ звучит ни как «всегда Fable 5», ни как «всегда Opus 5»: выбирать нужно под задачу. Выход Opus 5 24 июля 2026 года заметно сместил этот ответ: предыдущее поколение, Opus 4.8, занимало нишу «на ступеньку слабее Fable 5, зато вдвое дешевле», тогда как Opus 5 сохраняет ту же цену $5 / $25 и при этом не уступает Fable 5 на агентных бенчмарках, а местами и обходит её (Frontier-Bench 43.3% против 33.7% и OSWorld 2.0 70.6% против 66.1% — цифры из прессы; по CursorBench 3.2 Anthropic официально заявляет, что укладывается в 0.5% от результата Fable 5 примерно за половину стоимости). Самые сложные рассуждения «в один заход» пока склоняются к Fable 5, но с минимальным отрывом: Humanity's Last Exam 56.5% против 56.3% и DeepSWE v1.1 69.7% против 68.8% (данные прессы). По характеристикам модели совпадают — контекстное окно 1M и максимальный вывод 128K; быстрый режим (примерно в 2.5 раза) есть только у Opus 5, но стоит вдвое дороже и работает только в Claude API, зато у Opus 5 более свежая граница знаний — май 2026 года. Схема решения: сначала пробуйте Opus 5 и поднимайтесь к Fable 5 только там, где он выходит на плато. На практике оптимальна связка «Opus 5 как основа, Fable 5 для сложного», подкреплённая автопереключением при блокировках защиты в приложении и новым резервным режимом «default» в API. Разбираем доступность (приостановка в июне, повторное развёртывание в июле), отказ от зависимости от одной модели, настройку effort ради экономии и частые вопросы — связывая кластер материалов по Fable 5 с руководством по релизу Opus 5.

Фреймворки ИИ-агентов, сравнение 2026: LangGraph, CrewAI, AutoGen, OpenAI, Google, Claude — что выбрать?

Фреймворки ИИ-агентов, сравнение 2026: LangGraph, CrewAI, AutoGen, OpenAI, Google, Claude — что выбрать?

Первое препятствие при встраивании ИИ-агента в реальную работу — «на каком фреймворке его собирать». С точки зрения разработчика и того, кто выбирает технологии, статья сравнивает шесть главных фреймворков — LangGraph, CrewAI, AutoGen (вошедший в Microsoft Agent Framework, GA апрель 2026), OpenAI Agents SDK, Google ADK и Claude Agent SDK — по подходу к оркестрации (ориентированный граф / ролевая команда / диалоговый GroupChat / передачи управления / иерархическое дерево / автономный цикл инструментов), языку, кривой обучения, управляемости, зрелости для прода, стоимости токенов и наиболее подходящему сценарию. Ключевая оговорка: фреймворк, «быстрейший для прототипа» (CrewAI), может оказаться самым дорогим в проде — около 3× токенов (41k против 18.5k у LangGraph в одном бенчмарке) и недетерминированный, что плохо подходит для финансов и здравоохранения. Также объясняется, как 2026 год принёс интероперабельность через MCP (инструменты) и A2A (агент-агент), так что агенты из разных фреймворков теперь работают вместе, а привязка ослабла. Включает гид по выбору под задачу и FAQ.

Полное руководство по Ollama: запуск локальных LLM одной командой [2026]

Полное руководство по Ollama: запуск локальных LLM одной командой [2026]

Ollama — стандартный инструмент с открытым исходным кодом для запуска локальных LLM, который берёт на себя почти всю утомительную настройку и позволяет скачать модель и начать диалог одной командой. В этом руководстве для новичков мы разберём весь путь от начала до конца: установку на Windows, Mac и Linux, основные команды, выбор моделей по размеру и VRAM, добавление GUI вроде Open WebUI, использование локального и совместимого с OpenAI API для встраивания в приложения, настройку через Modelfile и переменные окружения, а также решение типичных проблем.

Лучшие локальные LLM 2026: сравнение моделей (Qwen, Llama, DeepSeek и др.)

Лучшие локальные LLM 2026: сравнение моделей (Qwen, Llama, DeepSeek и др.)

Какую локальную LLM поставить первой? В статье разобраны основные семейства моделей 2026 года — Qwen, Llama, Gemma, DeepSeek, Mistral, Phi — по разработчику, стране происхождения, сценарию, размеру и лицензии, чтобы помочь выбрать модель под ваш ПК и задачи. Отдельный раздел посвящён русскоязычным и локальным моделям: мультиязычные Qwen и Llama с сильным русским, открытые проекты Saiga, Vikhr и T-lite / T-pro от Т-Банка, а также пояснение, почему YandexGPT и GigaChat — это в основном облачные API, а не локальные модели с открытыми весами.

Сколько VRAM нужно для локальной LLM: гайд по железу [2026]

Сколько VRAM нужно для локальной LLM: гайд по железу [2026]

Запустится ли локальная LLM на вашем ПК, на 90% решает VRAM — память GPU. В этой статье собраны быстрая таблица требуемого VRAM по размеру модели (7B, 13B, 32B, 70B) и простая формула расчёта, разобрано влияние квантизации (FP16/Q8/Q4) и ловушка с KV-кэшем, который растёт вместе с длиной контекста. Приведены реалистичные скорости для RTX 3060/4090/5090 и Mac, а также рекомендуемые сборки по трём бюджетным уровням, чтобы новичок сразу понял, что покупать.

Локальная LLM vs облачная: различия и разрыв в качестве [2026]

Локальная LLM vs облачная: различия и разрыв в качестве [2026]

Локальная LLM на вашем ПК против облачных Claude, ChatGPT и Gemini — оба «LLM», но различаются по качеству, стоимости, приватности и усилиям. Эта статья ставит их рядом в одном сравнении и честно показывает, насколько по состоянию на 2026 год сократился часто неправильно понимаемый «разрыв в качестве». Затем она подскажет, что выбрать под вашу задачу, разбирая железо для разных размеров моделей и точку безубыточности по стоимости. Для большинства людей ответ — гибрид: повседневная работа локально, самые сложные части в облаке.

Настройка effort в Claude Code: уровни и Ultracode простыми словами

Настройка effort в Claude Code: уровни и Ultracode простыми словами

Регулятор «Faster ↔ Smarter» в Claude Code задаёт, сколько токенов модель тратит на ответ. У effort 5 уровней (low–max), а ползунок добавляет режим Ultracode — итого 6 пунктов. Разбираем, почему «Extra» = xhigh (а не максимум), как настроить через /effort и какой уровень выбирать.

Что такое Agent Evals? Измеряем и результат, и trajectory

Что такое Agent Evals? Измеряем и результат, и trajectory

Agent Evals — это процесс систематического измерения того, способен ли агент, который использует инструменты и делает несколько шагов к цели, действительно выполнять свои задачи. Это эволюция LLM evals, расширяющая объект оценки с «одного вывода» до «последовательности действий». Поскольку агент планирует, вызывает инструменты и обновляет состояние, одного финального вывода недостаточно; Google отмечает, что нужно понимать «почему» за действиями агента, и делит оценку на финальный ответ и trajectory. Пять измерений: outcome (успех задачи, судят по финальному состоянию — существует ли бронь в DB, а не по высказыванию «я забронировал»), trajectory (разумные шаги, правильные инструменты в правильном порядке), корректность использования инструментов (правильный инструмент и аргументы, проверка имён функций и типов), эффективность (шаги, токены, стоимость, задержка — часто сигналы observability, привнесённые в оценку) и качество финального ответа (через LLM-as-judge или рубрику). Грейдеры — это код (быстрый/дешёвый/воспроизводимый, но хрупкий), LLM-as-judge (гибкий, но недетерминированный и требует калибровки) и человек (золотой стандарт, но дорогой — избегайте по возможности). Anthropic рекомендует оценивать результат, а не путь: механическое сопоставление trajectory «слишком жёсткое и хрупкое», поскольку агенты находят допустимые альтернативы, тогда как Google и Microsoft предлагают метрики сопоставления trajectory для диагностики провалов. Уникальные подводные камни — недетерминированность (pass^k), накапливающиеся ошибки (p^t), reward hacking (роботизированная рука DeepMind, имитирующая захват) и устаревшие или загрязнённые наборы eval. Практический приём, по Anthropic: превратить 20–50 продакшен-провалов в тест-кейсы, запустить автоматическую оценку в CI, разделить capability и regression evals и писать их рано. Бенчмарки вроде SWE-bench, tau-bench, WebArena, GAIA, OSWorld и BFCL полезны как референсы (оценки меняются от версии, поэтому не принимайте их за чистую монету). На основе официальной информации, с пометкой неопределённостей.

Что такое хуки Claude Code? Запуск shell-команд детерминированно

Что такое хуки Claude Code? Запуск shell-команд детерминированно

Хуки Claude Code — это определяемые пользователем shell-команды, которые автоматически запускаются в определённых точках жизненного цикла Claude Code, делая «это должно происходить всегда» реальным и детерминированным, не полагаясь на усмотрение LLM. Классических событий девять — SessionStart, UserPromptSubmit, PreToolUse, PostToolUse, Notification, Stop, SubagentStop, SessionEnd, PreCompact — из которых PreToolUse и другие могут блокировать (останавливая правки защищённых файлов или опасные команды). Настраиваете вы их в settings.json под ключом «hooks» как имя события -> matcher -> type + command. Контракт ввода/вывода: хук получает JSON на stdin (session_id, tool_input и т. д.) и возвращает результат через код выхода 0 (успех) / 2 (блок, со stderr, переданным обратно Claude) или структурированный JSON (continue, decision:block, permissionDecision: deny/allow/ask). Ключевой принцип: «хуки могут ужесточать, но не ослаблять ограничения» (deny всегда побеждает, блокирует даже при bypassPermissions). Классические сценарии: автоформат после правок (PostToolUse + Edit|Write), защита критичных файлов, остановка опасных команд, повторное внедрение контекста (SessionStart), уведомления/аудит и тесты перед остановкой (Stop). О безопасности: хуки выполняют произвольные shell-команды с вашими правами, поэтому настраивайте только доверенные и проверяйте/заключайте в кавычки входные данные; конфигурация хуков фиксируется при старте сессии (защитная функция), поэтому изменения в середине сессии не применяются. На основе официальной документации, с опорой на девять классических событий и контракт ввода/вывода.

Что такое checkpointing и /rewind в Claude Code? Откат изменений

Что такое checkpointing и /rewind в Claude Code? Откат изменений

Checkpointing и /rewind — это страховка: Claude Code автоматически отслеживает правки файлов, сделанные Claude, по мере работы, так что вы можете откатиться к состоянию "до того, как всё пошло не так" за несколько нажатий клавиш. Снимок делается перед каждым редактированием, каждый отправленный вами промпт становится точкой восстановления, а checkpoint-ы сохраняются между сессиями. Чтобы воспользоваться, введите /rewind или дважды нажмите Esc при пустом поле ввода, чтобы открыть меню, затем выберите точку и действие: Restore code and conversation / Restore conversation / Restore code (учтите: если в поле есть текст, двойное Esc вместо этого очистит его). Самая важная оговорка: восстанавливаются только изменения, сделанные инструментами редактирования Claude (Write/Edit/NotebookEdit) — изменения файлов командами bash (rm/mv/cp), изменения вне сессии или из других сессий, операции с каталогами, удалённые файлы и состояние базы данных откатом НЕ отменяются. В документации это формулируется как "checkpoint-ы = локальная отмена, Git = постоянная история": он дополняет, но не заменяет контроль версий, поэтому делать коммиты в Git на ключевых этапах — правило. /rewind также является средством восстановления при ошибке 400, связанной с параллелизмом tool-use и блоками размышления (продукт сам предлагает его запустить), хотя версии до v2.1.156 могут её не устранять, поэтому сначала идёт claude update. Включён по умолчанию в интерактивном CLI, opt-in в Agent SDK, хранится вместе с сессиями 30 дней (настраивается). На основе официальной документации, с пометками о неопределённостях.