Перейти к содержимому
Темы

AI-агенты и автоматизация: RAG, воркфлоу и гайды

Разберитесь в AI-агентах, RAG и автоматизации процессов. От концепций до реальных применений.

50 статей

Сортируйте статьи, чтобы найти нужное

Статьи в категории AI-агенты и автоматизация

Что такое Jev: применение, цены и ограничения ИИ TypeSafe для принятия решений

Что такое Jev: применение, цены и ограничения ИИ TypeSafe для принятия решений

Jev — модель TypeSafe, которая вместо свободного текста возвращает выбранные варианты, оценки и вероятности «да»/«нет». Разбираем различия Choice, Score и Noul, смысл confidence и устройство API-запроса для распределения обращений в поддержку. Гарантия типа не гарантирует правильность решения. В статье рассмотрены документированные ограничения при вычислениях, работе с датами и вводом, навязывающим ответ, а также цены, оба ограничения ввода и проверка перед применением на русском языке. Материал основан на официальных источниках, а не на практических замерах API.

Что такое Projects в Claude Code: как Claude раздаёт треды, кому доступна бета, зачем нужен GitHub и сколько это стоит в токенах

Что такое Projects в Claude Code: как Claude раздаёт треды, кому доступна бета, зачем нужен GitHub и сколько это стоит в токенах

Projects в Claude Code собрали заново. Раньше проект был папкой, в которой лежали диалоги и справочные материалы; новые Projects — это один диалог. Вы описываете, что вам нужно, Claude разбивает это на треды, треды параллельно выполняются в облаке, и каждый по завершении открывает pull request и отчитывается. Закрытый ноутбук их не останавливает. Правда, прежде чем бросаться пробовать, стоит проверить три вещи: круг аккаунтов по-прежнему ограничен (публичная бета для Pro и Max, которая в первую очередь доходит до аккаунтов без существующих проектов), github.com и Claude GitHub App на практике обязательны, а скорость, с которой всё это съедает лимит использования, несопоставима с одиночной сессией. Статья разбирает, как понять, дошёл ли до вас выкат, с чем стартует тред (включая ловушку, из-за которой правила разрешений и хуки перестают применяться, как только в проекте оказывается больше одного репозитория), откуда берётся расход токенов, в том числе из стоящего по умолчанию Opus с усилием high, и как выбрать из пяти способов работать параллельно: субагенты, agent view, команды агентов, динамические рабочие процессы и Projects — всё по официальной документации и блогу.

Действительно ли GPT-6 Astra на low дешевле? Токены, стоимость и скорость против GPT-5.6 Sol на high

Действительно ли GPT-6 Astra на low дешевле? Токены, стоимость и скорость против GPT-5.6 Sol на high

Новая модель умнее, но дороже — так обычно и рассуждают. Однако сравнение GPT-6 Astra с GPT-5.6 Sol по одной удельной цене ничего не решает: Astra заканчивает ту же работу меньшим числом токенов. По замерам независимой измерительной компании Artificial Analysis, Astra на самом слабом уровне low обходится за одну задачу почти ровно в ту же сумму, что и Sol на high ($0.82 против $0.81), и при этом набирает больше (46 против 42), тратя втрое меньше выходных токенов и заставляя вчетверо меньше ждать начала ответа. Опираясь на цифры по состоянию на 18 сентября 2026 года, статья разбирает стоимость, токены и скорость на каждом уровне рассуждения, расчёт, объясняющий, почему удельная цена выше в 2.5 раза, а итог тот же, что будет с числами после окончания промоцены Sol, как разрыв в цене сокращается на работе кодинг-агентов и какими шагами измерить всё это на своей собственной работе.

GPT-6 Astra: полный разбор релиза — цена, доступ по тарифам, изменения при миграции и сравнение с Claude

GPT-6 Astra: полный разбор релиза — цена, доступ по тарифам, изменения при миграции и сравнение с Claude

OpenAI выпустила GPT-6 Astra 3 сентября 2026 года. API общедоступен без гейтинга, идентификатор модели — gpt-6-astra, контекстное окно — 1 050 000 токенов, цена — $10 за вход и $50 за выход на миллион токенов, граница знаний — 30 апреля 2026 года. Но «вышла» и «доступна на вашем тарифе» — разные вещи: в ChatGPT Plus модель не появляется в обычном окне чата, и входом служат ChatGPT Work и Codex. В статье разобраны доступность по тарифам, способ правильно ставить вопрос о цене, когда вдвое большая удельная ставка всё равно может выйти дешевле в пересчёте на задачу, перечень бенчмарков, которые OpenAI действительно назвала, впервые достигнутый уровень Critical по кибербезопасности в Preparedness Framework и граница, которую OpenAI вокруг него провела, четыре вещи, ломающиеся при миграции (убранные параметры сэмплирования, Responses API, исчезнувший уровень рассуждения none, переименованная настройка кеша), а также сравнение с Claude Opus 5, Fable 5.1 и Gemini 3.8 Flash — везде только в тех пределах, которые удалось подтвердить по первоисточникам. Отдельно объяснено, почему здесь нет ходящей по другим сайтам таблицы вида «Astra 74.1% против Opus 5 96%».

Dispatch у Claude — как телефон управляет вашим ПК и насколько это безопасно

Dispatch у Claude — как телефон управляет вашим ПК и насколько это безопасно

Dispatch — это функция, где вы отправляете указание со смартфона, а Claude выполняет работу на вашем собственном компьютере (бета, тарифы Pro и Max). Работает это не в облаке: двигается ваша реальная машина, и из одного этого факта растут и вся польза, и вся опасность. Официальная справка говорит, что вы можете написать Claude со смартфона, чтобы он поработал на вашем настольном компьютере, используя те же коннекторы, плагины и доступ к файлам, которые вы уже настроили в Cowork, внутри того, что Anthropic называет одним непрерывным диалогом, доступным с любого из двух устройств. Для работы нужно, чтобы компьютер не спал, а десктопное приложение было открыто; управление компьютером поддерживается только на macOS и Windows, а на Linux его нет. Механически всё идёт по трём уровням приоритета: коннектор, если он доступен, работа в браузере, если коннектора нет, и прямые действия на экране как последнее средство, причём по ходу дела делаются скриншоты, чтобы понять происходящее на экране. Оценка начинается после этого. Места, где Claude останавливается, заложены в конструкцию: управление компьютером выключено по умолчанию и включается в разделе «Настройки», «Основные»; разрешение запрашивается для каждого нового приложения; безвозвратное удаление файла требует явного разрешения; а инвестиционные и торговые платформы вместе с криптовалютными приложениями закрыты по умолчанию. Но есть и места, где он не останавливается. Отдельные действия внутри уже разрешённого приложения с вами не согласовываются, и официальная формулировка гласит, что Claude кликает, печатает и перемещается по вашему экрану напрямую, без тех проверок разрешений, которые ограничивают остальные инструменты Cowork. Документация добавляет, что между Claude и тем, что на вашем экране, нет никакой песочницы, и что действия, предпринятые в одном приложении, могут повлиять на другие приложения. Самый большой риск — внедрение промпта, и Anthropic описывает его собственными словами: содержимое веба является основным каналом для атак через внедрение промпта, а подменённое указание, неожиданная команда или фишинговая ссылка, открытая в вашем браузере, могут вылиться в цепочку действий, которые трудно или невозможно отменить. Anthropic заявляет, что сканирует активации модели для выявления такого поведения, но это снижает вероятность, а не отменяет необходимость провести собственную черту, и рекомендации по-прежнему советуют переключаться на ручное подтверждение всякий раз, когда задача затрагивает чувствительные файлы, аккаунты или сайты. Границу Anthropic называет прямо: не давайте разрешение на управление компьютером чувствительным приложениям — банковским, медицинским, государственным, — и избегайте финансовых счетов, юридических документов, медицинской информации и персональных данных. Статья разбирает и сторону телефона. При его потере утекают не данные, хранящиеся на нём, а право отдавать распоряжения вашему компьютеру плюс содержимое продолжающегося диалога. Официальная справка по Dispatch не описывает ни отвязку устройства, ни порядок действий при утере, поэтому средства реагирования приходят со стороны аккаунта: завершение отдельной сессии в разделе «Настройки», «Аккаунт», «Активные сессии»; выход из всех сессий на claude.ai, который недоступен в мобильных приложениях и потому требует веб-браузера; либо просто обрыв со стороны компьютера — закрыть десктопное приложение или дать машине уснуть, и это на деле самый быстрый способ, потому что Dispatch требует, чтобы компьютер не спал, а приложение было открыто. Завершается всё разделением Dispatch и управления компьютером на два разных переключателя, отличием обоих от agent view в Claude Code (который официальная документация тоже называет dispatch) и практической чертой: начинайте с работы, которую можно отыграть назад.

Agent view в Claude Code — как сессии идут параллельно и где протекает изоляция

Agent view в Claude Code — как сессии идут параллельно и где протекает изоляция

Agent view в Claude Code, открываемый командой claude agents, — это функция, позволяющая одну за другой запускать независимые фоновые сессии и управлять ими с одного экрана. Официальная документация называет выполняемую там операцию словом dispatch, и это название пересекается с отдельной функцией десктопного приложения, носящей то же имя, поэтому первое дело — научиться их различать. Документация описывает agent view как функцию, которая позволяет диспетчеризовать множество сессий Claude Code с одного экрана и управлять ими; это research preview, требующий версии v2.1.139 или новее. Статья держится механики и модели безопасности. Первая неожиданность в том, что каждый введённый в поле промпт запускает собственную новую сессию: наберёте второй — получите вторую сессию рядом с первой, а не дополнительное указание к первой. Дополнительные указания идут через панель быстрого просмотра, открываемую клавишей Space, где показывается последний вывод или вопрос, ответа на который ждёт сессия, а не вся переписка целиком. Ядро модели безопасности — изоляция через worktree. Перед редактированием любого файла фоновая сессия переходит в изолированный git worktree внутри .claude/worktrees/, поэтому параллельные сессии читают один и тот же checkout, но каждая пишет в свой собственный: чтение общее, запись разделена. Всё, что дотянулось бы до основного checkout, отсекается тремя проверками — правки файлов через Edit, Write и NotebookEdit; рабочие каталоги команд, которые разрешаются в основной checkout или про которые нельзя проверить, что они останутся снаружи; и попытки перенаправить git через git -C, --git-dir, GIT_DIR, GIT_WORK_TREE или через cd, поставленный перед вызовом git. Решение сознательно принято в пользу безопасности: то, что нельзя проверить, не выполняется, и та же защита наследуется каждым субагентом, которого породит сессия. При этом стеной уровня ОС это не является: файлы за пределами репозитория и сеть в область действия не входят, а к командам PowerShell применяется только проверка рабочего каталога. Разрешения тоже не выбираются в момент диспетчеризации — они наследуются из defaultMode этого каталога или из permissionMode во фронтматтере диспетчеризованного субагента, а значит, чем свободнее ваша обычная конфигурация, тем больше беспризорных сессий с широкими правами вы создаёте разом. Дальше три вещи утекают из изоляции наружу. Выбор варианта «Да, больше не спрашивать» сохраняет правило в .claude/settings.local.json основного checkout, поэтому оно действует и в основном checkout, и во всех остальных worktree, и переживает удаление того worktree, в котором было принято. Удаление сессии в agent view удаляет вместе с ней созданный Claude worktree, так что незакоммиченная работа исчезает, а Ctrl+X останавливает на первое нажатие и удаляет на второе. А .worktreeinclude копирует попавшие в gitignore файлы вроде .env в каждый новый worktree, умножая ваши учётные данные на число диспетчеризованных сессий. Вдобавок квота расходуется пропорционально параллелизму (десять агентов тратят её примерно в десять раз быстрее), а сессии выполняются локально: они переживают спящий режим, но останавливаются при выключении машины. В конце статья ставит agent view в один ряд с четырьмя официальными способами распараллелить работу — рядом с субагентами, командами агентов и динамическими рабочими процессами — и даёт конкретный порядок действий до, во время и после диспетчеризации.

ChatGPT Work: что это и как использовать (GPT-5.6)

ChatGPT Work: что это и как использовать (GPT-5.6)

ChatGPT Work — это «ИИ-агент для работы», который OpenAI представила 9 июля 2026 года вместе с GPT-5.6. В отличие от обычного чата, который просто отвечает, он собирает контекст из подключённых приложений и файлов, чтобы создавать готовые результаты — документы, таблицы, слайды и даже веб-приложения. Его мозг — новый флагман GPT-5.6 Sol (на базе Codex), и он может разбить сложный проект на шаги и работать часами (Thurrott). Внутри единого десктопного приложения сосуществуют три режима — Work (результаты), Codex (технический, показывает детали) и обычный чат (диалог), — причём Work позиционируется как «бизнес-версия», которая прячет технические детали Codex (9to5Mac). Модель зависит от тарифа: Free/Go по умолчанию используют Terra, а Plus/Pro/Business/Enterprise выбирают из Sol/Terra/Luna (по сообщениям СМИ). Его сила — подтягивание «вашего контекста» через коннекторы вроде Google Drive, SharePoint и Slack, плюс MCP, а для предприятий данные по умолчанию не используются для обучения. Опираясь на Axios, TechCrunch, 9to5Mac, Thurrott и OpenAI, эта статья раскладывает по полочкам, что такое ChatGPT Work, чем он отличается от обычного ChatGPT и Codex, на каких тарифах доступен и к каким приложениям подключается — с метками достоверности для того, что ещё не стало официальным.

GPT-5.6 Sol против Gemini 3.1 Pro: агентный кодинг против мультимодальности — полное сравнение

GPT-5.6 Sol против Gemini 3.1 Pro: агентный кодинг против мультимодальности — полное сравнение

GPT-5.6 Sol и Gemini — редкий случай, когда сильные стороны почти не пересекаются: Sol доминирует в терминальном и агентном кодинге (Terminal-Bench 88.8% против 68.5%, SWE-bench Pro 64.6% против 54.2%), тогда как Gemini 3.1 Pro отвечает нативной мультимодальностью со звуком и видео, ценой примерно вдвое ниже и лидерством в MMLU, ARC-AGI-2 и WebDev Arena. Важная оговорка: настоящий конкурент Gemini 3.5 Pro на момент статьи ещё не вышел (GA — середина июля), поэтому честное сравнение сегодня идёт с 3.1 Pro. Разбираем характеристики, бенчмарки, реальную стоимость и выбор под задачу.

GPT-5.6 vs GPT-5.5: от одного флагмана к трём моделям — Terra за 40% цены

GPT-5.6 vs GPT-5.5: от одного флагмана к трём моделям — Terra за 40% цены

Спустя два с половиной месяца после GPT-5.5 вышла GPT-5.6, и главное изменение — не прирост мощности, а переход от единого флагмана к трём моделям: Luna ($0.20/$1.20), Terra ($2/$12) и Sol ($5/$30). Сильнее всего бьёт Terra: качество уровня GPT-5.5 намного дешевле — на старте вполовину, а после снижения цен 30 июля 2026 г. за 40% цены GPT-5.5 ($2/$12), что делает её фактическим преемником существующих нагрузок. Sol сохраняет цену $5/$30 и поднимает SWE-Bench Pro с 58.6 до 64.6% (оц., +6 пт), а эффективность токенов выросла на 10–15%. Разбираем, что изменилось и на какую модель переходить.

GPT-5.6 Sol vs Claude Fable 5: подробное сравнение флагманов (кодинг, автономность, цена)

GPT-5.6 Sol vs Claude Fable 5: подробное сравнение флагманов (кодинг, автономность, цена)

Сравнение двух асимметричных лидеров: «универсал за полцены» GPT-5.6 Sol против Claude Fable 5 высшего класса. Fable 5 впереди в кодинге производственного уровня (SWE-Bench Pro 80.3% vs 64.6% оц.) и длительной автономности до 12 часов, а Sol лидирует по работе с терминалом (TerminalBench 88.8%), агентной широте и стоит вдвое дешевле. Разбираем, как распределять роли по сценариям и стоимости.

GPT-5.6 Sol против Claude Opus 4.8: детальное сравнение бенчмарков, кодинга, цены и как выбрать

GPT-5.6 Sol против Claude Opus 4.8: детальное сравнение бенчмарков, кодинга, цены и как выбрать

Детальное сравнение двух гигантов AI-кодинга 2026 года — Claude Opus 4.8 (28 мая) и старшей модели Sol в линейке GPT-5.6 (9 июля). Их сильные стороны почти противоположны: Sol лидирует в работе с терминалом и общей агентной мощи (TerminalBench 2.1 88.8% против 78.9% у Opus, Agents' Last Exam 53.6, Coding Agent Index 80), а Opus 4.8 — в кодинге производственного уровня, математике и длинном контексте (SWE-bench Pro 69.2% против 64.6% у Sol, USAMO 2026 96.7%, GraphWalks 1M 68.1%) и делает ставку на честность (десятикратное снижение самоуверенности, 0% некритичных отчётов о дефектных результатах). К тому же OpenAI не публикует многие бенчмарки Sol (SWE-bench Pro, GPQA, AIME, MMLU), так что в цитадели кодинга преимущество у раскрывшегося Opus. Разбираем таблицу характеристик, детали бенчмарков, проблему закрытых бенчмарков, реальную стоимость ($25 vs $30 против +54% эффективности токенов), карту сильных и слабых сторон, выбор под задачу и стратегию двойной эксплуатации.

Релиз GPT-5.6: полный обзор — Luna/Terra/Sol, бенчмарки, цены и сравнение с Claude

Релиз GPT-5.6: полный обзор — Luna/Terra/Sol, бенчмарки, цены и сравнение с Claude

9 июля 2026 г. OpenAI открыла общий доступ к GPT-5.6, заменив прежнюю схему «базовая + Pro» на три модели: Luna (быстрая, недорогая, $0.20/$1.20), Terra (баланс, $2/$12, уровень GPT-5.5 за 40% тарифа Sol) и Sol (флагман, $5/$30) — цены после пересмотра 30 июля 2026 г. Sol занимает первое место в Agents' Last Exam (53.6) и Coding Agent Index (80), а её 88.8% в TerminalBench 2.1 немного опережают Claude Fable 5 (86.0%) — однако в SWE-Bench Pro производственного уровня Claude Fable 5 уверенно лидирует с 80.0% против 64.6% у Sol. В статье разбираются различия трёх моделей, цены, бенчмарки, новые функции (Programmatic Tool Calling, ChatGPT Work, полнодуплексная голосовая модель GPT-Live), доступность по тарифам ChatGPT, сравнение с Claude (Fable 5 / Opus 4.8) и выбор модели под задачу — всё на основе официального анонса OpenAI и независимых бенчмарков.