Перейти к содержимому
Темы

AI-агенты и автоматизация: RAG, воркфлоу и гайды

Разберитесь в AI-агентах, RAG и автоматизации процессов. От концепций до реальных применений.

45 статей

Сортируйте статьи, чтобы найти нужное

Статьи в категории AI-агенты и автоматизация

ChatGPT Work: что это и как использовать (GPT-5.6)

ChatGPT Work: что это и как использовать (GPT-5.6)

ChatGPT Work — это «ИИ-агент для работы», который OpenAI представила 9 июля 2026 года вместе с GPT-5.6. В отличие от обычного чата, который просто отвечает, он собирает контекст из подключённых приложений и файлов, чтобы создавать готовые результаты — документы, таблицы, слайды и даже веб-приложения. Его мозг — новый флагман GPT-5.6 Sol (на базе Codex), и он может разбить сложный проект на шаги и работать часами (Thurrott). Внутри единого десктопного приложения сосуществуют три режима — Work (результаты), Codex (технический, показывает детали) и обычный чат (диалог), — причём Work позиционируется как «бизнес-версия», которая прячет технические детали Codex (9to5Mac). Модель зависит от тарифа: Free/Go по умолчанию используют Terra, а Plus/Pro/Business/Enterprise выбирают из Sol/Terra/Luna (по сообщениям СМИ). Его сила — подтягивание «вашего контекста» через коннекторы вроде Google Drive, SharePoint и Slack, плюс MCP, а для предприятий данные по умолчанию не используются для обучения. Опираясь на Axios, TechCrunch, 9to5Mac, Thurrott и OpenAI, эта статья раскладывает по полочкам, что такое ChatGPT Work, чем он отличается от обычного ChatGPT и Codex, на каких тарифах доступен и к каким приложениям подключается — с метками достоверности для того, что ещё не стало официальным.

GPT-5.6 Sol против Gemini 3.1 Pro: агентный кодинг против мультимодальности — полное сравнение

GPT-5.6 Sol против Gemini 3.1 Pro: агентный кодинг против мультимодальности — полное сравнение

GPT-5.6 Sol и Gemini — редкий случай, когда сильные стороны почти не пересекаются: Sol доминирует в терминальном и агентном кодинге (Terminal-Bench 88.8% против 68.5%, SWE-bench Pro 64.6% против 54.2%), тогда как Gemini 3.1 Pro отвечает нативной мультимодальностью со звуком и видео, ценой примерно вдвое ниже и лидерством в MMLU, ARC-AGI-2 и WebDev Arena. Важная оговорка: настоящий конкурент Gemini 3.5 Pro на момент статьи ещё не вышел (GA — середина июля), поэтому честное сравнение сегодня идёт с 3.1 Pro. Разбираем характеристики, бенчмарки, реальную стоимость и выбор под задачу.

GPT-5.6 vs GPT-5.5: от одного флагмана к трём моделям — Terra за 40% цены

GPT-5.6 vs GPT-5.5: от одного флагмана к трём моделям — Terra за 40% цены

Спустя два с половиной месяца после GPT-5.5 вышла GPT-5.6, и главное изменение — не прирост мощности, а переход от единого флагмана к трём моделям: Luna ($0.20/$1.20), Terra ($2/$12) и Sol ($5/$30). Сильнее всего бьёт Terra: качество уровня GPT-5.5 намного дешевле — на старте вполовину, а после снижения цен 30 июля 2026 г. за 40% цены GPT-5.5 ($2/$12), что делает её фактическим преемником существующих нагрузок. Sol сохраняет цену $5/$30 и поднимает SWE-Bench Pro с 58.6 до 64.6% (оц., +6 пт), а эффективность токенов выросла на 10–15%. Разбираем, что изменилось и на какую модель переходить.

GPT-5.6 Sol vs Claude Fable 5: подробное сравнение флагманов (кодинг, автономность, цена)

GPT-5.6 Sol vs Claude Fable 5: подробное сравнение флагманов (кодинг, автономность, цена)

Сравнение двух асимметричных лидеров: «универсал за полцены» GPT-5.6 Sol против Claude Fable 5 высшего класса. Fable 5 впереди в кодинге производственного уровня (SWE-Bench Pro 80.3% vs 64.6% оц.) и длительной автономности до 12 часов, а Sol лидирует по работе с терминалом (TerminalBench 88.8%), агентной широте и стоит вдвое дешевле. Разбираем, как распределять роли по сценариям и стоимости.

GPT-5.6 Sol против Claude Opus 4.8: детальное сравнение бенчмарков, кодинга, цены и как выбрать

GPT-5.6 Sol против Claude Opus 4.8: детальное сравнение бенчмарков, кодинга, цены и как выбрать

Детальное сравнение двух гигантов AI-кодинга 2026 года — Claude Opus 4.8 (28 мая) и старшей модели Sol в линейке GPT-5.6 (9 июля). Их сильные стороны почти противоположны: Sol лидирует в работе с терминалом и общей агентной мощи (TerminalBench 2.1 88.8% против 78.9% у Opus, Agents' Last Exam 53.6, Coding Agent Index 80), а Opus 4.8 — в кодинге производственного уровня, математике и длинном контексте (SWE-bench Pro 69.2% против 64.6% у Sol, USAMO 2026 96.7%, GraphWalks 1M 68.1%) и делает ставку на честность (десятикратное снижение самоуверенности, 0% некритичных отчётов о дефектных результатах). К тому же OpenAI не публикует многие бенчмарки Sol (SWE-bench Pro, GPQA, AIME, MMLU), так что в цитадели кодинга преимущество у раскрывшегося Opus. Разбираем таблицу характеристик, детали бенчмарков, проблему закрытых бенчмарков, реальную стоимость ($25 vs $30 против +54% эффективности токенов), карту сильных и слабых сторон, выбор под задачу и стратегию двойной эксплуатации.

Релиз GPT-5.6: полный обзор — Luna/Terra/Sol, бенчмарки, цены и сравнение с Claude

Релиз GPT-5.6: полный обзор — Luna/Terra/Sol, бенчмарки, цены и сравнение с Claude

9 июля 2026 г. OpenAI открыла общий доступ к GPT-5.6, заменив прежнюю схему «базовая + Pro» на три модели: Luna (быстрая, недорогая, $0.20/$1.20), Terra (баланс, $2/$12, уровень GPT-5.5 за 40% тарифа Sol) и Sol (флагман, $5/$30) — цены после пересмотра 30 июля 2026 г. Sol занимает первое место в Agents' Last Exam (53.6) и Coding Agent Index (80), а её 88.8% в TerminalBench 2.1 немного опережают Claude Fable 5 (86.0%) — однако в SWE-Bench Pro производственного уровня Claude Fable 5 уверенно лидирует с 80.0% против 64.6% у Sol. В статье разбираются различия трёх моделей, цены, бенчмарки, новые функции (Programmatic Tool Calling, ChatGPT Work, полнодуплексная голосовая модель GPT-Live), доступность по тарифам ChatGPT, сравнение с Claude (Fable 5 / Opus 4.8) и выбор модели под задачу — всё на основе официального анонса OpenAI и независимых бенчмарков.

Что такое LLM-шлюз (прокси)? Один API для всех провайдеров — гид 2026

Что такое LLM-шлюз (прокси)? Один API для всех провайдеров — гид 2026

Вы построили всё на OpenAI, затем захотели попробовать Claude и сравнить Gemini — и потеряли часы на разных SDK, форматах и обработке ошибок у каждого провайдера. LLM-шлюз (AI-шлюз / LLM-прокси) — это ретранслятор, который вы ставите между приложением и провайдерами: он предоставляет один совместимый с OpenAI API для обращения к любой модели и берёт на себя сквозные задачи — fallback, учёт затрат, виртуальные ключи, кэширование, ограничение частоты и наблюдаемость. В этом гиде: зачем он нужен, что такое шлюз на самом деле, три типа (self-hosted прокси = LiteLLM / hosted = OpenRouter / SDK = Vercel AI SDK), как выбрать среди LiteLLM, OpenRouter и Vercel AI SDK, минимальный код настройки, где меняется лишь эндпоинт, и ограничения — скачок задержки, шлюз как новая точка отказа, комиссии (OpenRouter берёт 5,5% при пополнении), потеря возможностей и приватность.

Evals для ИИ-агентов: 5 способов измерить качество (2026)

Evals для ИИ-агентов: 5 способов измерить качество (2026)

Построив ИИ-агента, вы всегда упираетесь в одну стену: «Хорошо, но он вообще работает?» Механизм, позволяющий решить, стало от изменения промпта или модели лучше или хуже на основе данных, а не интуиции, — это evals. LLM выдают разный результат каждый раз для одного и того же ввода, поэтому юнит-тесты на точное совпадение не подходят. Эта статья рассказывает, что такое evals, о пяти способах измерить качество (① сверка с эталоном ② проверки по правилам ③ LLM-as-judge ④ регрессионное тестирование ⑤ мониторинг в продакшене), об оценке, специфичной для агентов (доля успешных задач, корректные вызовы инструментов, траектория, стоимость), о том, как начать с малого с 20 примеров отказов, о частых ловушках и ключевых инструментах (Anthropic Console/Evals, OpenAI Evals, LangSmith, Langfuse, Ragas) — она написана для практиков.

ИИ-агенты против RPA: в чём разница и что когда выбирать (2026)

ИИ-агенты против RPA: в чём разница и что когда выбирать (2026)

Извечный вопрос автоматизации: «ИИ-агенты или RPA?» Ответ — не «или — или»: выбирайте по роли, а выигрышный паттерн 2026 года — гибрид обоих. RPA — детерминированные «руки», которые быстро и точно выполняют фиксированную процедуру (но ломаются при изменении экрана/спецификации); ИИ-агент — вероятностный «мозг», который считывает ситуацию и принимает решение (силён в неоднозначности и исключениях, но результат не одинаков каждый раз). В статье: разница в принципе действия, сравнительная таблица (компромисс воспроизводимости и устойчивости к изменениям), как выбрать (ось — «можно ли полностью описать правилами?»: да → RPA, суждение, которое не описать → ИИ-агент), тренд 2026 года (лидеры RPA — UiPath, Automation Anywhere, Blue Prism — становятся агентными; сближение; вопрос уже не «что из двух», а «где живёт рассуждение» = оркестрация прежде всего) и практический ответ: гибрид, где мозг (ИИ-агент) отвечает за суждение/оркестрацию, а руки (RPA) выполняют детерминированное исполнение — не ставьте агента туда, где нужна детерминированность, а делегированное суждение сочетайте с ограждениями и согласованием человеком. На основе официальной информации вендоров, с FAQ.

Как доверить управление AWS ИИ: методы, плюсы и минусы (2026)

Как доверить управление AWS ИИ: методы, плюсы и минусы (2026)

Можно ли передать эксплуатацию AWS искусственному интеллекту? В 2026 году делегировать можно многое. Сама AWS поставляет Amazon Q Developer и Agent Toolkit for AWS (май 2026 — 40+ навыков агента + управляемый AWS MCP Server + плагины), так что ИИ дотягивается от генерации IaC до операций с ресурсами. Это руководство разбивает «делегирование» на три уровня (① генерация кода/IaC, ② эксплуатация/расследование с упором на чтение, ③ автономный агент, реально управляющий AWS), рассматривает основные инструменты (Amazon Q Developer, Agent Toolkit, AWS MCP Server, Terraform MCP, Bedrock AgentCore) — включая путь «со своим инструментом», когда Claude Code или Codex получают AWS CLI для запуска «aws» из shell, — плюсы (быстрый IaC, автоматическая сортировка, идеи по оптимизации затрат, демократизация знаний), а затем самое главное — минусы (разрастание прав IAM, избыток прав как усилитель радиуса поражения ошибок/инъекций промпта, права, переживающие задачу, неконтролируемый рост затрат — с реальными случаями удаления продакшн-БД в 2025-26), на основе официальных материалов AWS и данных вендоров безопасности. Ключевой поворот: вопрос не «может ли он?», а «как делегировать без потери контроля и взрыва счёта» — и то, что сама AWS встроила защитные механизмы IAM, аудит CloudTrail и песочницу в Agent Toolkit, показывает форму ответа. Включает пять принципов (IAM с минимальными привилегиями, одобрение человека для деструктивных операций, наблюдаемость, краткоживущие учётные данные JIT, песочница) и FAQ.

Фреймворки ИИ-агентов, сравнение 2026: LangGraph, CrewAI, AutoGen, OpenAI, Google, Claude — что выбрать?

Фреймворки ИИ-агентов, сравнение 2026: LangGraph, CrewAI, AutoGen, OpenAI, Google, Claude — что выбрать?

Первое препятствие при встраивании ИИ-агента в реальную работу — «на каком фреймворке его собирать». С точки зрения разработчика и того, кто выбирает технологии, статья сравнивает шесть главных фреймворков — LangGraph, CrewAI, AutoGen (вошедший в Microsoft Agent Framework, GA апрель 2026), OpenAI Agents SDK, Google ADK и Claude Agent SDK — по подходу к оркестрации (ориентированный граф / ролевая команда / диалоговый GroupChat / передачи управления / иерархическое дерево / автономный цикл инструментов), языку, кривой обучения, управляемости, зрелости для прода, стоимости токенов и наиболее подходящему сценарию. Ключевая оговорка: фреймворк, «быстрейший для прототипа» (CrewAI), может оказаться самым дорогим в проде — около 3× токенов (41k против 18.5k у LangGraph в одном бенчмарке) и недетерминированный, что плохо подходит для финансов и здравоохранения. Также объясняется, как 2026 год принёс интероперабельность через MCP (инструменты) и A2A (агент-агент), так что агенты из разных фреймворков теперь работают вместе, а привязка ослабла. Включает гид по выбору под задачу и FAQ.

Что такое наблюдаемость ИИ? Мониторинг и трассировка LLM и агентов для новичков

Что такое наблюдаемость ИИ? Мониторинг и трассировка LLM и агентов для новичков

В статье «Как построить мультиагентную систему» мы советовали инструментировать каждую передачу управления до добавления агентов; технология, которая обеспечивает это в продакшене, — наблюдаемость ИИ. Она делает видимым то, что LLM и агенты на самом деле делают в продакшене (какая модель с каким промптом, какие инструменты и поиски, что возвращено, сколько времени и денег), чтобы можно было проследить путь до причины. Решающее отличие от обычного мониторинга: ИИ может вернуть 200 OK за 50ms и при этом уверенно галлюцинировать, поэтому большинство сбоев ИИ — это сбои качества (галлюцинации, слабое извлечение, небезопасные ответы, незавершённые задачи, плохое использование инструментов, регрессии после изменения промпта), а не инфраструктуры. Наблюдаемость опирается на три столпа: trace (один запрос как дерево span с вызовами LLM, инструментами, извлечением, цепочками рассуждений; главный элемент наблюдения ИИ), метрики (задержка, стоимость, токены, частота ошибок, пропускная способность) и логи (детали по событиям). Отраслевой стандарт — соглашения GenAI в OpenTelemetry — фиксирует промпты, ответы, использование токенов и вызовы инструментов/агентов в схеме без привязки к вендору, которую можно направить в Datadog/Grafana. Чаще всего путают наблюдаемость и оценку (evals): наблюдаемость показывает, что произошло (легко измерить, но нельзя сказать, верен ли ответ), а evals измеряют, хорош ли ответ (точность, groundedness, безопасность), и требуют явной оценки. Поскольку стоимость и задержку измерить легко, а качество ответа — нет, инструменты 2026 года совмещают показ trace с оценкой выходов и оповещениями о деградации. Метрики делятся на операционные (стоимость, задержка, токены, частота ошибок) и качественные (галлюцинация, groundedness/достоверность, важнейшая для RAG, безопасность, завершение задачи); обнаружение галлюцинаций — через LLM-as-a-judge, семантическое сходство и оценки groundedness. Основные инструменты: LangSmith (LangChain), Langfuse (open-source self-host), Arize Phoenix (отладка RAG), MLflow (жизненный цикл), AgentOps (агенты) и OpenTelemetry (стандарт). Начните со сбора trace (совместимо с OpenTelemetry), визуализируйте операционные метрики, затем подключите evals до выпуска. Для мультиагентных систем наблюдение необходимо, так как сбои прячутся в многошаговых цепочках, видимых только в trace всей сессии. Наблюдать плюс оценивать — вот что делает ИИ продакшен-уровнем. Иллюстрации и характеристики приведены по публичным материалам, как ориентир.