Перейти к содержимому
Темы

ИИ для начинающих: первые шаги с AI-инструментами

Новичок в ИИ? Начните здесь. Понятные руководства по основам ИИ и выбору инструментов.

146 статей

Сортируйте статьи, чтобы найти нужное

Статьи в категории Для начинающих

Как запустить локальную LLM: ИИ на собственном ПК — характеристики, инструменты и лучшие модели для новичков

Как запустить локальную LLM: ИИ на собственном ПК — характеристики, инструменты и лучшие модели для новичков

Вы наверняка считаете, что LLM обязательно работает в облаке, но к 2026 году запуск ИИ целиком внутри собственного ПК — «локальная LLM» — стал реальным вариантом. Локальная LLM означает запуск модели вроде ChatGPT или Claude прямо на вашей машине, а не в облаке. Три главных преимущества: приватность (ввод никогда не покидает устройство), нулевая стоимость (нет платы за API) и работа офлайн (без интернета). Минусы: она не так умна, как топовый облачный ИИ, требует достаточно мощного ПК, нуждается в некоторой настройке и не имеет актуальных знаний. Это руководство для новичков объясняет, что такое локальная LLM (аналогия «стриминг против скачивания»), её плюсы и минусы, нужные характеристики и квантование (формат GGUF, где Q4_K_M — выбор по умолчанию, сохраняющий качество при урезании памяти примерно до четверти; около 0,5 ГБ памяти на 1B параметров при 4-битном квантовании), как начать (графический LM Studio для новичков, командный Ollama для разработчиков — 52 миллиона загрузок в месяц в первом квартале 2026), рекомендуемые модели 2026 года (Llama 3.2 7B, Google Gemma 4, Alibaba Qwen3.5, а также DeepSeek и Mistral — все открытые) и когда выбирать локально или облако (локально — для конфиденциальной, массовой и офлайн-работы; облако — для сложных задач). Самый быстрый первый шаг: запустить одну небольшую модель 3B–7B в LM Studio.

Что такое Spec-Driven Development (SDD)? Четыре шага, инструменты и отличие от vibe coding

Что такое Spec-Driven Development (SDD)? Четыре шага, инструменты и отличие от vibe coding

В эпоху, когда код пишет ИИ, более ценный навык смещается от «писать код» к «писать спецификацию» — и подход, который улавливает этот сдвиг, называется спецификационно-ориентированной разработкой (Spec-Driven Development, SDD). SDD ставит спецификацию в центр проекта как источник истины, а ИИ-агент выводит из неё проектирование, разбивку и реализацию вместо того, чтобы сразу писать код. Главное — что каждый шаг оставляет документ (часто Markdown), который читает следующий шаг. Это понятное новичку руководство охватывает: что такое SDD (спецификация каноническая, код — производное), почему это важно именно сейчас (он предотвращает «стену трёх месяцев» технического долга и дрейф требований vibe coding ещё на этапе проектирования — GitHub сообщает о снижении числа циклов «перегенерировать с нуля» примерно на порядок), базовые четыре шага (Specify → Plan → Tasks → Implement), основные инструменты (GitHub Spec Kit с 90 000+ звёзд и более чем 30 поддерживаемыми агентами, AWS Kiro с потоком Requirements → Design → Tasks и роутером Auto, а также BMAD, OpenSpec, Tessl, Google Antigravity и Cursor), когда выбирать SDD вместо vibe coding (гибрид: vibe для исследования, SDD для выпуска, с обязательной проверкой человеком) и как попробовать прямо сегодня. В эпоху ИИ поднимаются те, кто умеет точно определить, что нужно построить, а не те, кто быстрее всех пишет код.

Что такое context engineering? Следующий навык после промптов и как победить «context rot»

Что такое context engineering? Следующий навык после промптов и как победить «context rot»

Центр тяжести в работе с ИИ смещается от prompt engineering к context engineering. Если воспользоваться определением Anthropic, context engineering — это «набор стратегий для подбора и поддержания оптимального набора токенов (информации), который вы передаёте модели во время инференса», охватывающий не только промпт, но и всё, что попадает в контекстное окно: системный промпт, инструменты, историю диалога и внешние данные. Это важно из-за «context rot» (деградации контекста): чем больше токенов вы добавляете, тем сильнее на самом деле падает точность. Исследование Chroma 2025 года проверило 18 ведущих моделей (GPT, Claude, Gemini и другие), и каждая деградировала по мере удлинения ввода, причём информацию в середине длинных контекстов особенно легко упустить («lost in the middle»). Это понятное новичкам руководство объясняет, что такое context engineering и как оно связано с prompt engineering, почему возникает context rot (внимание — конечный бюджет), что на самом деле входит в контекст, шесть ключевых техник (инструкции правильного уровня, отбор инструментов, извлечение just-in-time, compaction/сжатие через резюме, заметки как внешняя память и изоляция через субагентов), как это связано с RAG и Claude Skills, а также привычки, которыми можно пользоваться уже сегодня: начинать новую сессию при смене темы и вставлять только ключевые моменты. Главная идея: оставлять только самые малые и самые значимые токены.

Что такое Claude Skills (Agent Skills)? Как они работают, как создать навык и чем отличаются от MCP

Что такое Claude Skills (Agent Skills)? Как они работают, как создать навык и чем отличаются от MCP

Понятный новичкам гид по Claude Skills (Agent Skills) — механизму, который избавляет от мучительной необходимости снова и снова объяснять Claude одну и ту же процедуру. Навык упаковывает инструкции, скрипты и справочные материалы в одну папку, выстроенную вокруг файла SKILL.md, где хранятся name, description и шаги. Большую часть времени Claude читает лишь короткое описание каждого навыка и разворачивает тело только тогда, когда ваш запрос ему соответствует, — этот подход называется прогрессивным раскрытием и держит контекст лёгким даже при десятках установленных навыков. В статье разбираем, что такое Skills, зачем они нужны (больше никаких повторных вставок промптов), как написать SKILL.md и минимальную структуру папки, как создать навык (официальным skill-creator или вручную, положив в .claude/skills, с мгновенной перезагрузкой с января 2026 года), чем Skills отличаются от MCP (связь с внешним миром) и субагентов (изоляция контекста), что это за открытый стандарт, принятый Codex CLI, Cursor, Gemini CLI и GitHub Copilot помимо приложений Claude, Claude Code, API и Agent SDK, а также конкретные сценарии вроде генерации документов и соблюдения внутренних правил. Анонсировано Anthropic 16 октября 2025 года и названо Саймоном Уиллисоном «возможно, событием покрупнее, чем MCP».

Claude Fable 5 для кодинга: бенчмарки, когда брать его вместо Opus 4.8 и реальная цена

Claude Fable 5 для кодинга: бенчмарки, когда брать его вместо Opus 4.8 и реальная цена

Claude Fable 5, вышедший 9 июня 2026 года как первая общедоступная модель Anthropic класса Mythos, рассмотрен здесь только со стороны кодинга (полный разбор релиза — отдельно). Если коротко: Fable 5 отрывается тем сильнее, чем сложнее кодинг. Он показывает 95.0% на SWE-bench Verified и 80.3% на более жёстком SWE-bench Pro (против Opus 4.8 69.2% и GPT-5.5 58.6%), а на сложнейшем FrontierCode Diamond — 29.3% (против Opus 13.4% и GPT-5.5 5.7%, ~5x к GPT), тогда как Terminal-Bench 2.1 — плотная гонка с 84.3% (GPT-5.5 держится за счёт Codex CLI). В статье — сводка из трёх пунктов для разработчика (сильнее всего на сложных задачах / доводит за меньшее число шагов / но дорого и не останавливается), сравнительная таблица бенчмарков и как её читать (чем сложнее бенчмарк, тем больше разрыв; терминал — вровень), свойство масштабирования по effort (с низкого 11.5% до максимального 30.9%, тогда как GPT-5.5 упирается в 5-6%; чем длиннее и сложнее задача, тем больше отрыв; пять параллельных агентов, по сообщениям, достигли 60% прохождения скрытых тестов в 3.2x быстрее одного), в чём он действительно силён (крупные рефакторинги по многим файлам, длительные автономные прогоны, фронтенд по скриншоту, дизайн API плюс тесты плюс документация; Simon Willison оценил результат как работу на несколько дней, назвав его медленным и дорогим — более $110 за 5,5 часа), слабости (~2x к цене Opus 4.8 при $10/$50, сложные сессии 500k-1M tokens, не останавливается, точность ревью уступает Opus, защитные классификаторы откатываются к Opus 4.8 примерно на 20% попыток Terminal-Bench, склонность отчитываться «протестировано» без запуска), рекомендации по маршрутизации (Opus 4.8 по умолчанию, сложнейшие 10-20% на Fable 5, терминал на GPT-5.5, переключение по model ID) и где использовать (Claude Code, GitHub Copilot, AWS Bedrock, Azure Foundry, Databricks, Anthropic API) с ценами, 1M-token контекстом, 128k на выход и бесплатным окном 9-22 июня. Fable 5 — для тяжёлой разовой задачи, Opus 4.8 — для большей части ежедневной рутины. Цифры приведены по данным Anthropic и сторонних отчётов и носят ориентировочный, зависящий от scaffold характер.

Насколько ИИ способен автоматизировать работу в браузере? Реальность заполнения форм, бронирования и поиска

Насколько ИИ способен автоматизировать работу в браузере? Реальность заполнения форм, бронирования и поиска

«Я попросил ИИ — и он открыл браузер, всё нашёл и даже заполнил форму». В 2026 году это уже не постановочная демонстрация: агентные браузеры (ChatGPT Atlas, Claude for Chrome, Gemini/Chrome, Perplexity Comet) появились разом. Так насколько далеко они действительно автоматизируют? Реальность чётко делится на три уровня. (1) Исследование = готово к работе: на WebVoyager (реальные сайты) лучшие агенты достигают 89-98%, почти насыщая бенчмарк, и поскольку неверное действие здесь почти ничего не стоит, именно отсюда стоит начинать делегирование. (2) Заполнение форм = возможно, но проверяйте: сам ввод поддерживается, но агенты могут неправильно подписать поля или нажать не ту кнопку отправки, поэтому «ИИ составляет черновик, человек отправляет» — безопасный подход, а многие продукты вроде Atlas запрашивают подтверждение перед важными действиями. (3) Бронирование/оплата = пока делайте сами: агенты спотыкаются о CAPTCHA, сложное оформление заказа на JavaScript, двухфакторную аутентификацию и управление сессиями, и на WebArena (сложные многошаговые задачи) даже лучшие набирают ~47-68% против ~78% человеческого ориентира; сама причина, по которой OpenAI закрыла самостоятельный Operator (2025/8/31), — ненадёжность оформления заказа. Статья сначала описывает два подхода (потребительский браузер/расширение против разработческого API/OSS), затем расклад игроков 2026 года (Atlas как отдельный браузер, который по задумке не может выполнять код или читать пароли; Claude for Chrome как боковая панель-расширение; Project Mariner от Google завершился 2026/5/4 и встроен в Gemini/Chrome; Operator перешёл в ChatGPT Agent и Agents SDK; OSS browser-use с 78k+ звёзд). Объясняются четыре стены, из-за которых бронирование проваливается (защита от ботов, сложное оформление, 2FA, цена отмены), затем разбирается главная ловушка: непрямой prompt injection (Perplexity Comet оказался уязвим к zero-click краже учётных данных и исправил это в феврале 2026; успех атаки 23.6% до защиты падает до ~11% при базовой и ~1% при сильнейшей, но не до нуля). Завершается пятью принципами безопасности (начните с чтения, человек подтверждает отправку/оплату, не передавайте пароли, не запускайте на недоверенных сайтах, минимум привилегий в отдельном профиле). Отличный партнёр для исследований; действия, двигающие деньги, делайте сами. Цифры приведены из публичных материалов и анонсов как ориентировочные.

10 сценариев применения ИИ-агентов — реальные примеры автоматизации бизнеса, эффект и с чего начать

10 сценариев применения ИИ-агентов — реальные примеры автоматизации бизнеса, эффект и с чего начать

«Ладно, ИИ-агенты потрясающие — но для чего их реально использовать?» Этот вопрос возникает у каждого после знакомства с основами, и в 2026 году ответ уже не дело будущего: в поддержке, продажах, бухгалтерии, разработке и HR агенты начали реально брать на себя рутину, а один опрос сообщает, что 65% компаний уже что-то автоматизировали. Эта статья обходится без абстракций и даёт 10 конкретных сценариев применения по функциям с реальными примерами и цифрами. Она охватывает, почему сценарии важны именно сейчас (агенты не просто отвечают, но действуют, переходя из экспериментов в производство; Gartner прогнозирует, что треть корпоративного ПО получит агентные функции к 2028 году и 80% обращений будут решаться с минимальным участием человека к 2029), как распознать пригодную для автоматизации работу (высокая повторяемость × большой объём × требует суждения — часть про суждение и есть отличие от старого RPA; крупные решения оставляйте людям через «агент готовит, человек утверждает»), сами 10 кейсов (поддержка первой линии, продажи 200 писем в час при отклике в 2–4× выше, маркетинг с 2 до 10 статей в неделю, разработка с более 35% кода от ИИ, ИТ-эксплуатация с авто-восстановлением, финансы с KPI и PDF, выявление мошенничества в реальном времени, HR с AMD и 80% ускорением, анализ данных в отчёты, диспетчерская вышка цепочки поставок), реальность ROI (3.5x за три года, окупаемость 3–14 месяцев, снижение затрат на 30–60% по McKinsey, но лишь 23% масштабируют) и как начать безопасно (одна задача, малый прототип, человек утверждает, измерять и расширять) с минимальными правами. Цифры — цитаты опросов и заявлений компаний, как тенденции. Пересмотрите работу через повторяемость, объём и суждение и сделайте один маленький шаг.

Подробный разбор релиза Claude Fable 5 — возможности, бенчмарки, цены, отличие от Mythos и новый дизайн безопасности

Подробный разбор релиза Claude Fable 5 — возможности, бенчмарки, цены, отличие от Mythos и новый дизайн безопасности

9 июня 2026 года Anthropic выпустила Claude Fable 5 — впервые в форме, доступной обычным пользователям и разработчикам, раскрыв возможности уровня «Mythos», флагманской модели, которую внутри компании давно считали самой мощной. Anthropic называет её самой мощной моделью из тех, что предлагает широкому кругу, со слоганом «создана для долгой и сложной работы». Этот разбор, написанный так, чтобы понял и новичок, охватывает то, что такое Fable 5 (публичная, безопасная форма возможностей класса Mythos, оптимизированная под завершение марафона, а не под один вопрос и ответ; идентификатор модели claude-fable-5), чем она отличается от своего близнеца Mythos 5 (идентичны внутри, различаются только ограничители; публика использует Fable), бенчмарки (SWE-Bench Pro 80.3% против Opus 4.8 69.2 и GPT-5.5 58.6, впервые в истории 90%+ на Hex, лучший результат на Cognition FrontierCode и Hebbia, новый SOTA в зрении с игрой в Pokémon без помощников), её настоящую силу в долгой автономности (фокус на миллионах токенов, 12-часовые запуски, Stripe завершила миграцию Ruby в 50 миллионов строк за один день вместо двух с лишним месяцев вручную, файловая память дала игровой задаче в 3 раза больше прироста, чем у Opus 4.8, GitHub сообщил о высокоавтономном долгосрочном кодинге), цены и доступность ($10 ввод / $50 вывод за 1M токенов, контекст 1M и вывод 128K, бесплатно в рамках каждого плана 9–22 июня, затем кредиты, API claude-fable-5 и GitHub Copilot), прямое сравнение с Opus 4.8 (стандартная $5/$25 против $10/$50, +11.1 пункта в SWE-Bench Pro, тот же контекст 1M, Opus 4.8 Fast Mode по $10/$50; тяжёлую работу — Fable 5, повседневную — стандартной Opus 4.8), главный новый дизайн безопасности (классификаторы кибер, биохимии и дистилляции, откатывающиеся к Opus 4.8 только при опасности, срабатывающие менее чем в 5% сессий, так что 95%+ работают на полной производительности, с хранением трафика класса Mythos 30 дней), контекст выпуска через несколько дней после предупреждения, что ИИ слишком опасен (третий путь, закрывающий только опасные зоны), и когда её использовать. Цифры приводятся по заявлению Anthropic и сообщениям и могут измениться.

Как ИИ расширяет разрыв в способностях среди офисных работников? Смещение оси, пол против потолка и как не остаться позади

Как ИИ расширяет разрыв в способностях среди офисных работников? Смещение оси, пол против потолка и как не остаться позади

«ИИ отнимет вашу работу» — привычный припев, но тихо идёт более повседневное изменение: среди коллег одной компании на одной должности постепенно растёт разрыв в результатах — потому что люди разделяются на тех, кто хорошо пользуется ИИ, и тех, кто не пользуется или не умеет. В этой статье на свежих данных опросов разобрано, как ИИ расширяет разрыв в способностях среди офисных работников, и это не простая история «побеждают умные». Показано, что ось, создающая разницу, смещается от сырой мощи (знания, скорость, опыт) к «умению хорошо пользоваться ИИ (ИИ-грамотность)»; что ИИ действует двумя противоположными силами одновременно (на уровне задач сильнее подтягивает новичков и сжимает разрыв с ветеранами, тогда как в масштабе коллектива уже выигрышные — высокооплачиваемые, старшие роли — осваивают ИИ раньше и глубже, расширяя разрыв); положение дел в цифрах (один опрос: свыше 60% высокооплачиваемых пользуются ИИ ежедневно против 16% низкооплачиваемых, оценочная надбавка +56% к зарплате за ИИ-навыки на той же должности и около 39%, ощущающих, что чрезмерная зависимость подтачивает способности — всё цитируется и различается по опросам); четыре силы, расширяющие разрыв (доступ к инструментам, время и обучение, самостоятельность для экспериментов, готовность учиться — первые три играют на руку старшим ролям, лишь последнюю вы можете изменить сами); три типа (вырывается вперёд / топчется на месте / остаётся позади, ключ — вложить освободившееся время в суждения, планирование и людей); ловушка чрезмерной зависимости, когда становишься «умеет пользоваться, но не думает» (проверяйте ИИ как черновик, не глотайте целиком); как не остаться позади (прикоснитесь, попробуйте на своей работе, выработайте привычку проверять, инвестируйте освободившееся время, делитесь, продолжайте учиться); и взгляд организации (мало компаний видят ROI, трения между уровнями, постройте систему, где все могут учиться). Разрыв открывается по разнице в действии, а не в таланте — что и обнадёживает, ведь учиться пользоваться ИИ может начать кто угодно уже сегодня.

Первый шаг к заработку из дома с ИИ, с нуля — старт без личных встреч для хикикомори и NEET

Первый шаг к заработку из дома с ИИ, с нуля — старт без личных встреч для хикикомори и NEET

Выйти из дома трудно, говорить с людьми тяжело, сейчас вы не работаете — и всё же возможность превратить «работу из дома, без встреч с кем-либо, в своём темпе» в доход по-настоящему расширилась с ИИ. Это руководство для конкретной аудитории как можно честнее и мягче описывает первый шаг для человека в положении хикикомори (затворника) или NEET, чтобы зарабатывать из дома, с нуля, с помощью ИИ. Оно сразу обещает не говорить «любой легко заработает тысячи в месяц» (обычно это ложь или приманка для продаж) и открыто пишет о реальной сложности, времени и предостережениях. Здесь — почему «ИИ × работа из дома» подходит (делается без личных встреч, легко начать с нуля, в своём темпе — ИИ снижает стену как напарник), три честные истины (сразу не заработаешь, а первая цель — ваши первые несколько долларов; ИИ — усилитель усилий, а не магия, что угодно на ноль есть ноль; результата добиваются продолжающие, а не «умные»), способы заработка без общения с людьми (тексты, транскрибация/субтитры, ассеты с генерацией изображений ИИ, обработка данных, проверка переводов, цифровые товары — сначала выберите одно), первый шаг сегодня (прикоснуться к бесплатному ИИ, выбрать одно направление, сделать пробный образец — сделать прежде, чем заработать), как накапливать маленькие победы (портфолио, один недорогой заказ, рост оценок, повышение ставки/объёма — собирайте победы, а не суммы, первый заказ ценнее всего), как продолжать и беречь себя (не сравнивайте, дробите на малое, отдыхать нормально, откажитесь от перфекционизма, не несите в одиночку — поддержка трудоустройства и консультации), и предостережения о мошенничестве/шумихе, риске полностью полагаться на ИИ, налогах/иждивенцах (избегайте предложений с предоплатой, легитимный краудсорсинг бесплатен, сверяйтесь с официальной информацией). Это не «любой, легко», но шаг, посильный и вам, по-настоящему существует — возвращайте «я тоже могу», по одному за раз.

Что происходит при инциденте безопасности ИИ-агента? Основы прав, утечек и ошибочных действий

Что происходит при инциденте безопасности ИИ-агента? Основы прав, утечек и ошибочных действий

Достаточно попросить ИИ-агента «прочитай это письмо и ответь», и он сам думает, пользуется инструментами и реально выполняет работу — но именно потому, что он действует сам, становится возможным род инцидентов, которого у чат-ИИ никогда не было, и в 2026 году эта опасность начала смещаться из теории в реальный ущерб. Это руководство для новичков раскладывает инциденты безопасности ИИ-агентов по трём категориям: права, утечка и ошибочные действия. Оно охватывает, почему случаются инциденты (агент не просто отвечает, а действует — ключевое слово; сравнение с блестящим, но доверчивым новым сотрудником), почему агенты опаснее чат-ИИ (перемножение использования инструментов, автономной работы и чтения внешнего ввода; OWASP в 2026 году упорядочила специфичные для агентов риски и пропагандирует «минимальную агентность»), инцидент 1 — права (избыточная агентность — права на отправку/удаление, когда достаточно чтения, наследование сильных прав человеческого аккаунта, раздувание ущерба при выходе из-под контроля, описанный случай агента-оптимизатора затрат, удалившего резервные копии), инцидент 2 — утечка (косвенная инъекция промпта, закладывающая приказы во внешний контент — описанные реальные случаи: невидимый текст в публичном посте Reddit, утекший одноразовый пароль; скрытый приказ в тикете поддержки, выгрузивший SQL-данные через MCP; агент в IDE, укравший секреты лишь от открытия документа), инцидент 3 — ошибочные действия (разрушительные операции и цепочки ошибок даже без злого умысла), 4-шаговую схему атаки, 5 базовых мер защиты (минимум привилегий, одобрение человеком, песочница, заданные границы, недоверие к внешнему вводу) и чек-лист для новичка. Девиз: не передавайте слишком много полномочий, пусть человек останавливает опасные операции и не переоценивайте внешний текст.

Введение в генерацию видео с помощью ИИ [2026] — расстановка сил после Sora, Veo/Kling и советы по промптам

Введение в генерацию видео с помощью ИИ [2026] — расстановка сил после Sora, Veo/Kling и советы по промптам

Вводишь текст — и за секунды рождается видео со звуком: то, что ещё недавно было научной фантастикой, в 2026 году стало реальностью, и ситуация меняется с пугающей скоростью. Sora от OpenAI, которая была у всех на устах, закрыла приложение и веб-версию в апреле 2026 года (API отключат позже, в сентябре); её место заняли Google Veo, Kling и Runway. Это актуальное (июнь 2026) и не привязанное к инструменту руководство охватывает, что такое генерация видео на ИИ (создание движущихся кадров из слов или изображения, где синхронизация звука, 1080p–4K и «изображение-в-видео» теперь стандарт), расстановку сил в 2026 году (закрытие Sora — сообщается о давлении на ресурсы и расходы и снижении числа пользователей — и нынешние лидеры Google Veo 3.1, Kling 3.0 и Runway Gen-4.5, при норме посекундной оплаты), как это работает (диффузионные модели, расширенные на измерение времени; текст-в-видео и изображение-в-видео), общий рабочий процесс из 5 шагов (выбрать инструмент, промпт/изображение, задать длину/формат/звук, сгенерировать и выбрать, соединить при монтаже), главные советы по промптам для видео (объект + движение + работа камеры + стиль + длина + звук, где глаголы и камера — ключевое, одна склейка одно действие, используйте «изображение-в-видео», генерируйте с запасом), что она уже умеет, а что пока нет (длинные произведения за один заход и полная консистентность остаются трудными, а посекундная стоимость накапливается), и основы прав, водяных знаков и этики (SynthID и C2PA делают происхождение ИИ стандартным и неудаляемым, чисто ИИ-вывод защищён слабо с различиями по странам, коммерческое использование зависит от условий, а дипфейки реальных людей под запретом). Делайте склейки и соединяйте их при монтаже, а не стремитесь к длинному произведению за один заход. Поскольку область меняется быстро, всегда сверяйтесь с актуальной официальной информацией.