Содержание
- 1. Что изменилось: открытые модели дошли до агентного уровня
- 2. Инструментов два вида: Continue и Cline устроены по-разному
- 3. Первая ловушка: длину контекста определяет ваш VRAM
- 4. Выбор модели: что реально работает, по объёму VRAM
- 5. Настройка: самый короткий путь
- 6. Разрыв с облаком стало трудно измерить
- 7. Правда ли, что локальный запуск бесплатен
- 8. Что и когда выбирать
- Итоги
- FAQ
Заставить модель, работающую на вашем собственном ПК, писать код. Само по себе это было возможно и несколько лет назад, но возможным было именно автодополнение — дописать продолжение начатой строки. Агентный сценарий, когда модель читает репозиторий, правит несколько файлов и запускает тесты, для локального железа был слишком тяжёлым.
С конца 2025 года и на протяжении 2026-го это сдвинулось. Эта статья разбирает, до чего реально можно дойти сегодня и где вы застрянете, опираясь только на первоисточники. Вывод сразу: это работает, но есть один барьер, и если не поменять одну настройку, всё ломается молча.
📌 О цифрах в этой статье: все бенчмарки и характеристики моделей взяты из публикаций самих разработчиков (официальные материалы Mistral AI, официальная карточка модели Qwen, официальная документация Ollama, официальная документация Cline, официальные материалы Anthropic). Ничего не переписано из обзорных подборок, потому что во время подготовки материала я несколько раз натыкался на подборки, где оценки одной версии модели были приписаны совсем другой.
1. Что изменилось: открытые модели дошли до агентного уровня
Яснее всего перемену показывает то, что сами разработчики моделей теперь продвигают их как инструмент для агентного программирования.
В официальной карточке модели Qwen написано, что модель поддерживает большинство платформ, таких как Qwen Code и CLINE, и располагает специально спроектированным форматом вызова функций, то есть расширения для редактора названы прямым текстом (карточка модели Qwen3-Coder-30B-A3B-Instruct). Иначе говоря, модель создавалась с прицелом на конкретного кодового агента.
Mistral AI движется в ту же сторону. Devstral 2, представленная 9 декабря 2025 года, — это специализированная модель, прямо ориентированная на агентное программирование, и младшая Devstral Small 2 (24B) выпущена под лицензией Apache 2.0 (Introducing: Devstral 2 and Mistral Vibe CLI).
Когда было только автодополнение
Дописать строку, которую вы печатаете. Хватает небольшой модели, и контекст может быть коротким. На локальном железе это шло без напряжения
Когда дело доходит до агента
Нужны точно оформленные вызовы инструментов и надёжно удерживаемый длинный контекст. Открытые модели, берущие эту планку, появились
2. Инструментов два вида: Continue и Cline устроены по-разному
Если начать, путая эти два инструмента, ожидания разойдутся с результатом. Оба являются расширениями VS Code, оба подключаются к Ollama, но их идеология совершенно разная.
| Continue | Cline | |
|---|---|---|
| Характер | Набор из автодополнения, чата и правок | Автономный кодовый агент |
| Как распределены роли | Своя модель на каждую роль: chat / edit / apply / rerank / autocomplete |
Одна модель ведёт всё от плана до исполнения |
| Требования к железу | Низкие. Для автодополнения хватает модели на несколько ГБ | Высокие. Нужны длинный контекст и точные вызовы инструментов |
| Для чего подходит | Ускорить собственные руки во время письма | Передать задачу целиком |
Схема Continue с отдельной моделью под каждую роль хорошо ложится на локальное железо, потому что автодополнению можно отдать маленькую быструю модель, а чату — крупную. Официальное руководство по Ollama прямо называет лёгкие модели для автодополнения, например qwen2.5-coder:1.5b и starcoder2:3b (Continue — Ollama guide).
⚠️ Правда, рекомендованные в официальной документации модели бывают устаревшими. Для чата приведённое выше руководство предлагает llama3.1:8b и deepseek-r1:32b, а это на несколько поколений позади того, что можно выбрать сегодня. Порядок действий из документации по-прежнему рабочий, но не принимайте названия моделей на веру: подберите их заново по разделу 4 «Выбор модели» ниже.
3. Первая ловушка: длину контекста определяет ваш VRAM
Это самый важный раздел статьи. Пропустите его — и окажетесь в положении, когда настройка прошла успешно, а агент на середине работы начинает вести себя бессвязно. И никакой ошибки при этом не возникает.
Причина в длине контекста, которую Ollama берёт по умолчанию. Это не фиксированное значение: оно выбирается автоматически по объёму вашего VRAM (Ollama — Context length).
| VRAM | Длина контекста по умолчанию |
|---|---|
| менее 24 GiB | 4k |
| от 24 до 48 GiB | 32k |
| 48 GiB и выше | 256k |
Обычный игровой ПК (8-16 ГБ VRAM) попадает в верхнюю строку. То есть 4k. Агент легко перешагивает этот порог, как только добавляются системный промпт, содержимое файлов и обмен вызовами инструментов, и тогда начало диалога тихо срезается. Он забывает указания, повторяет одно и то же действие, теряет цель: причина не в том, что модель глупая, а в том, что контекст выбрасывается прямо на входе.
Именно для такого сценария документация Ollama прямо указывает, что нужно задавать контекст не менее 64000 токенов для тяжёлых задач вроде веб-поиска и инструментов программирования. Настраивается это переменной окружения при запуске сервера.
OLLAMA_CONTEXT_LENGTH=64000 ollama serve
Если вы пользуетесь версией-приложением, то же самое меняется ползунком на экране настроек.
⚠️ Но одним увеличением дело не заканчивается. Документация предупреждает, что увеличение длины контекста повышает объём памяти, необходимый модели для работы.
Как только всё перестаёт помещаться в VRAM, часть модели вытесняется на CPU, и работа становится драматически медленнее. Проверяйте, действительно ли настройка сработала, командой ollama ps — так советует официальная документация. Именно там видно, целиком ли модель разместилась на GPU.
У Cline есть собственный ответ на ту же проблему. Официальная документация рекомендует включить Use Compact Prompt и сужать задачи, поскольку меньший контекст отвечает быстрее (Cline — Running models locally). Собственный системный промпт агента длинный, поэтому для его сжатия предусмотрена отдельная настройка.
4. Выбор модели: что реально работает, по объёму VRAM
На рекомендации из обзорных подборок лучше не полагаться. В том, что я проверил, встречались подборки, где модели середины 2025 года подавались как «выбор 2026 года», и одна, где оценка модели на 480B стояла в колонке модели на 30B. Ниже приведено только то, что опубликовали сами разработчики.
| Модель | Размер | Контекст | Лицензия | SWE-bench Verified |
|---|---|---|---|---|
| Qwen3.6-35B-A3B | 35B (активных 3B) | 262 144 (до 1 010 000) | Apache 2.0 | 73.4 |
| Devstral Small 2 | 24B | 256K | Apache 2.0 | 68.0% |
| Devstral 2 (для справки, слишком крупная) | 123B | 256K | Modified MIT | 72.2% |
Источники: карточка модели Qwen3.6-35B-A3B (Terminal-Bench 2.0 равен 51.5, QwenClawBench равен 52.6) и официальное объявление Mistral AI (9 декабря 2025 года). Эти оценки каждый разработчик измерял сам на своих моделях, а не третья сторона в едином прогоне.
Внимания заслуживает пометка «активных 3B» у Qwen3.6-35B-A3B. Из 35B на каждом проходе реально задействуется только 3B, и именно здесь себя окупает MoE (Mixture of Experts). Это конструкция, которая целится сразу и в сообразительность крупной модели, и в скорость небольшой, что делает её удачной для локального запуска.
Размер загрузки и требуемые характеристики
В библиотеке Ollama у qwen3.6 рядом стоят 27b (18GB) и 35b (23GB). Есть и теги с суффиксом -mlx для Mac.
Официальные ориентиры Cline по памяти таковы: 16-32GB для небольших моделей, 32-64GB для средних моделей под программирование и 64GB и более для крупных моделей с большим контекстом.
VRAM 8-12GB
Ограничьтесь автодополнением в Continue. Либо откажитесь от агентного пути, либо сочетайте его с облаком
VRAM 16-24GB
Devstral Small 2 (24B) уже в пределах досягаемости. Квантование обязательно, потому что нужен запас на увеличение контекста
VRAM 24GB и выше / единая память 32GB и выше
Qwen3.6 в вариантах 27b/35b становится реалистичной. Контекст по умолчанию тоже поднимается до 32k
Mistral пишет, что Devstral Small 2 работает на потребительских GPU и даже на конфигурациях только с CPU. Стоит, впрочем, держать в голове, что «работает» и «работает достаточно быстро, чтобы быть практичным агентом» — это разные вещи.
5. Настройка: самый короткий путь
1. Установить Ollama и задать контекст
Порядок важен. Длину контекста определяем до того, как тянуть модель.
OLLAMA_CONTEXT_LENGTH=64000 ollama serve
Сами шаги установки разобраны в материале полное руководство по Ollama, так что за ними обратитесь туда.
2. Загрузить модель
ollama pull qwen3.6:27b
Если с VRAM туго, выбирайте Devstral Small 2. От универсальной чат-модели обе они отличаются тем, что создавались с расчётом на агентное применение.
3. Убедиться, что модель на GPU
ollama ps
Не пропускайте эту проверку. Если часть модели вытеснена на CPU, ощущения будут совершенно другими. Большинство приговоров вида «локальные LLM слишком медленные, чтобы ими пользоваться» упираются именно в это.
4. Подключить расширение
И в Cline, и в Continue выбирают Ollama в качестве провайдера и указывают http://localhost:11434. Официальное предостережение Cline самое простое, убедитесь, что Ollama запущена, прежде чем отправлять промпт, и никакой особой конфигурации не требуется.
Если вы работаете с Cline, заодно включите Use Compact Prompt.
6. Разрыв с облаком стало трудно измерить
Здесь я хочу быть откровенным. Аккуратное сравнение вида «локальные модели дошли до X% от облака» сейчас построить невозможно. Причина в том, что бенчмарки перестали совпадать.
Сторона открытых моделей публикует SWE-bench Verified: 73.4 у Qwen3.6-35B-A3B, 68.0% у Devstral Small 2. Фронтирная сторона тем временем отходит от этой метрики.
И действительно, в объявлении Anthropic о Claude Opus 5 значения SWE-bench Verified нет вовсе. Перечислены Frontier-Bench v0.1, CursorBench 3.2, AA Coding Agent Index и FrontierCode 1.1, причём многое сформулировано в относительных, а не абсолютных выражениях (более чем двукратный рост производительности по сравнению с Opus 4.8, в пределах 0.5% от пиковой оценки Fable 5 и так далее).
⚠️ Поэтому, увидев утверждение, что локальная модель составляет столько-то процентов от Claude, отнеситесь к нему с подозрением. Велика вероятность, что обе стороны измерялись не по одной и той же метрике или что сравнение идёт с Claude нескольких поколений назад. Сегодня по SWE-bench Verified выстраиваются в ряд разве что открытые модели между собой.
Что о разрыве всё же можно сказать
Даже без сопоставимых цифр места, где разница проявляется структурно, вполне очевидны.
Где выигрывает локальный запуск
Код никогда не покидает машину, нет оплаты по счётчику (запускайте сколько угодно), работает офлайн, и нет ограничений частоты запросов
Где выигрывает облако
Рассуждение, охватывающее несколько файлов, устойчивость на длинных автономных прогонах, отсутствие начальных вложений и модель, которая обновляется без вашего участия
У того, что разрыв сильнее всего заметен в «рассуждении, охватывающем несколько файлов», есть причина. Такая работа расходует много контекста и нанизывает десятки решений одно на другое. Разница в точности одного решения умножается на каждом круге обмена. Отставание, которого не замечаешь при правке одного файла, становится ощутимым на масштабе репозитория.
7. Правда ли, что локальный запуск бесплатен
Счёт за API действительно не приходит, но бесплатным это не является. Просто изменилась форма затрат.
| Статья затрат | Локально | Облако |
|---|---|---|
| Начальные вложения | GPU с большим объёмом VRAM или много единой памяти | нет |
| Затраты, растущие с использованием | только электричество | оплата по токенам или подписка |
| Затраты, которые легко упустить | усилия на настройку и поддержание плюс отслеживание новых версий моделей | нет (их несёт поставщик) |
Поэтому ответ на вопрос, что дешевле, переворачивается в зависимости от условий сравнения. Если у вас уже есть GPU класса 24GB, локальный запуск обходится почти без дополнительных затрат. Если такого GPU нет, его цена покрывает подписку на годы вперёд. Точнее считать, что ответ зависит от двух вещей: гоняете ли вы много каждый день и есть ли у вас уже железо.
8. Что и когда выбирать
Веские причины выбрать локальный запуск
Код нельзя выносить наружу (договоры, внутренний регламент), железо у вас уже есть, вы хотите экспериментировать, не считая запросы, или работаете офлайн
Причины, которые таковыми не являются
«потому что бесплатно» (железо не посчитано) и «потому что выглядит быстрым» (облако чаще быстрее)
Самый реалистичный вариант — сочетать оба. Отдайте автодополнение Continue небольшой локальной модели и держите его запущенным постоянно, а крупные куски работы передавайте облачному агенту. Автодополнение частое и лёгкое на один вызов, что подходит локальному запуску; агент редкий и тяжёлый на один вызов, что подходит облаку. Профили нагрузки ровно обратные.
Итоги
- Открытые модели дошли до агентного программирования. И Qwen, и Mistral выпускают специализированные модели, прямо называющие расширения для редактора
- Главный барьер — длина контекста Ollama по умолчанию. При VRAM менее 24GiB это 4k, и агент ломается молча. Официальная рекомендация для задач программирования — 64000 и выше
- После увеличения проверьте через
ollama ps, что модель на GPU. Вытесненная на CPU, она становится медленной совсем иначе - Continue и Cline — разные инструменты. Первый распределяет модели по ролям для автодополнения, второй является автономным агентом. Требования к железу у них разные
- Сравнения вида «сколько процентов от облака» почти перестали держаться. Фронтирная сторона всё реже публикует SWE-bench Verified
- Это не «бесплатно», просто форма затрат другая. Ответ переворачивается в зависимости от того, есть ли у вас уже железо
FAQ
Q1. Можно ли запустить агентную связку на GPU с 8GB VRAM?
Это трудно, потому что даже если сама модель поместится, запаса на увеличение контекста не останется. При VRAM менее 24GiB значение по умолчанию у Ollama падает до 4k, а поднятие его до 64000 увеличивает требуемую память, и на 8GB совместить это тяжело. Реалистичные варианты — ограничиться автодополнением в Continue или запускать локально только автодополнение, а агента вынести в облако.
Q2. Cline или Continue, с чего начать?
Если локальные LLM для вас в новинку, начните с Continue, потому что требования к железу у него ниже, а неполадки проще локализовать. Убедитесь, что автодополнение работает комфортно, и только затем переходите к агентному пути: тогда вы сможете отделить проблему модели от проблемы конфигурации.
Q3. Работает ли это на Mac?
Да. Единая память заодно служит и как VRAM, поэтому крупные модели загружать даже проще. В библиотеке Ollama для qwen3.6 есть и теги с -mlx для Apple Silicon. Учтите, впрочем, что то же правило вывода длины контекста по умолчанию из объёма памяти действует и здесь, так что проверять всё равно нужно.
Q4. Какая модель «самая умная»?
Если судить только по опубликованным оценкам, самая высокая среди перечисленных здесь — Qwen3.6-35B-A3B с 73.4 по SWE-bench Verified. Но это собственные измерения каждого разработчика, а не сравнение третьей стороной в едином прогоне. На практике сильнее влияют лицензия (у Devstral Small 2 и Qwen3.6 обеих Apache 2.0) и то, поместится ли модель в имеющийся у вас VRAM.
Q5. Почему оно «ломается, не выдавая ошибки»?
Потому что всё, что выходит за длину контекста, обрабатывается как усечение, а не как ошибка. Модель совершенно нормально отвечает на тот фрагмент, который ей передали. В итоге это проявляется как забытые указания, повторяющиеся действия и потерянная цель, и выглядит так, будто модели просто не хватает способностей. Знание того, что при таком симптоме надо подозревать настройку, радикально меняет скорость поиска причины.
Q6. Какое квантование выбрать?
Если сомневаетесь, безопасно начать примерно с Q4_K_M. Различия между форматами (GGUF / GPTQ / AWQ) и способ выбора собраны в материале полное руководство по форматам квантования. Для задач программирования вариант «модель чуть поменьше с более мягким квантованием» обычно стабильнее, чем «модель побольше с более жёстким», потому что формат вызова инструментов нужно соблюдать точно.
Q7. Безопасно ли использовать это на корпоративном коде?
Пока всё остаётся локальным, код не покидает машину, и это главное преимущество локальной LLM. Но проверьте настройки самого расширения: даже когда провайдер указывает на Ollama, телеметрия или какая-то другая функция всё же может обращаться наружу. А вопрос о том, разрешает ли это ваш регламент, отделён от технической стороны, поэтому сначала сверьтесь с внутренними правилами.
Связанные статьи
- Полное руководство по Ollama — установка и базовые команды
- Подробное сравнение лучших локальных LLM — как выбирать по сценарию и размеру
- Какие характеристики ПК нужны для локальной LLM — справка по VRAM и GPU
- Полное руководство по форматам квантования — как выбрать между GGUF, GPTQ и AWQ
- Локальные LLM против облачных — разница в производительности и как выбрать